activity
20242026
collaborators
Showing cs.CLShow all

7 papers · 1 filter

cs.CL2026

Navigating Large-Scale Document Collections: MuDABench for Multi-Document Analytical QA

Zhanli Li, Yixuan Cao, Lvzhou Luo +1

This paper introduces the task of analytical question answering over large, semi-structured document collections. We present MuDABench, a benchmark for multi-document analytical QA…

cs.CL2025

The Gray Zone of Faithfulness: Taming Ambiguity in Unfaithfulness Detection

Qiang Ding, Lvzhou Luo, Yixuan Cao +1

Ensuring that Large Language Models (LLMs) generate summaries faithful to a given source document is essential for real-world applications. While prior research has explored LLM fa…

cs.CL2025

DETree: DEtecting Human-AI Collaborative Texts via Tree-Structured Hierarchical Representation Learning

Yongxin He, Shan Zhang, Yixuan Cao +2

Detecting AI-involved text is essential for combating misinformation, plagiarism, and academic misconduct. However, AI text generation includes diverse collaborative processes (AI-…

cs.CL2025

Reasoning Pattern Matters: Learning to Reason without Human Rationales

Chaoxu Pang, Yixuan Cao, Ping Luo

Large Language Models (LLMs) have demonstrated remarkable reasoning capabilities under the widely adopted SFT+RLVR paradigm, which first performs Supervised Fine-Tuning (SFT) on hu…

cs.CL2025

AttnComp: Attention-Guided Adaptive Context Compression for Retrieval-Augmented Generation

Lvzhou Luo, Yixuan Cao, Ping Luo

Retrieval-augmented generation improves the factual accuracy of Large Language Models (LLMs) by incorporating external context, but often suffers from irrelevant retrieved content…

cs.CL2025

Document-Level Tabular Numerical Cross-Checking: A Coarse-to-Fine Approach

Chaoxu Pang, Yixuan Cao, Ganbin Zhou +2

Numerical consistency across tables in disclosure documents is critical for ensuring accuracy, maintaining credibility, and avoiding reputational and economic risks. Automated tabu…