works on

From the 1 of 11 linked papers with an AI index.

activity
20242026
collaborators

11 papers

cs.CV2026

OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation

Yajing Xu, Yarong Lan, Jiaoyan Chen +6

The paper presents OmniPhys, a knowledge-graph-based benchmark for evaluating physical commonsense in text-to-image models, and OmniPrompt, an iterative optimization framework that…

cs.CL2026

CAGE: Cognitive Attribution Graphs for Faithful Inline Citation Generation in Long-Form Question Answering

Zhichao Yan, Shizhao Li, Jiapu Wang +5

Long-form question answering increasingly relies on retrieved evidence to make LLM outputs verifiable, with inline citations tracing claims to source documents. However, existing s…

cs.CL2026

Beyond Factual Accuracy: Evaluating Global Reasoning Integrity in RAG Systems with LogicScore

Zhichao Yan, Yunxiao Zhao, Jiapu Wang +4

Current evaluation methods for Retrieval Augmented Generation (RAG) suffer from \textit{factual myopia}: they relentlessly emphasize factual accuracy yet neglect global logical int…

cs.CL2025

Atomic Fact Decomposition Helps Attributed Question Answering

Zhichao Yan, Jiapu Wang, Jiaoyan Chen +3

Attributed Question Answering (AQA) aims to provide both a trustworthy answer and a reliable attribution report for a given question. Retrieval is a widely adopted approach, includ…

cs.CL2025

Prompting Large Language Models with Partial Knowledge for Answering Questions with Unseen Entities

Zhichao Yan, Jiapu Wang, Jiaoyan Chen +6

Retrieval-Augmented Generation (RAG) shows impressive performance by supplementing and substituting parametric knowledge in Large Language Models (LLMs). Retrieved knowledge can be…

cs.CL2025

Can LLMs Evaluate Complex Attribution in QA? Automatic Benchmarking using Knowledge Graphs

Nan Hu, Jiaoyan Chen, Yike Wu +6

Attributed Question Answering (AQA) has attracted wide attention, but there are still several limitations in evaluating the attributions, including lacking fine-grained attribution…