Publications (27)
Self-Evolved Diverse Data Sampling for Efficient Instruction Tuning
Shengguang Wu, Keming Lu, Benfeng Xu +3
Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory
Ruizhe Li, Mingxuan Du, Benfeng Xu +1
Entity Structure Within and Throughout: Modeling Mention Dependencies for Document-Level Relation Extraction
Benfeng Xu, Quan Wang, Yajuan Lyu +2
Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking
Yihan Chen, Benfeng Xu, Xiaorui Wang +2
Qwen Technical Report
Jinze Bai, Shuai Bai, Yunfei Chu +45
SearchAttack: Red-Teaming LLMs against Knowledge-to-Action Threats under Online Web Search
Yu Yan, Sheng Sun, Mingfeng Li +6
Wiki Live Challenge: Challenging Deep Research Agents with Expert-Level Wikipedia Articles
Shaohan Wang, Benfeng Xu, Licheng Zhang +5
MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing
Jiajia Lin, Mingxuan Du, Tuowen Zhou +2
The paper presents MPIE-Bench, a benchmark of 2,500 multi-person interaction editing examples, and MPIE-Eval, an evaluation method that uses mesh reconstruction to assess anatomica…
$k$NN Prompting: Beyond-Context Learning with Calibration-Free Nearest Neighbor Inference
Benfeng Xu, Quan Wang, Zhendong Mao +3
FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents
Chiwei Zhu, Benfeng Xu, Mingxuan Du +4
DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report
Ruizhe Li, Mingxuan Du, Benfeng Xu +3
MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools
Zikang Guo, Benfeng Xu, Chiwei Zhu +3
Benchmarking Large Language Models on Controllable Generation under Diversified Instructions
Yihan Chen, Benfeng Xu, Quan Wang +2
WildGraphBench: Benchmarking GraphRAG with Wild-Source Corpora
Pengyu Wang, Benfeng Xu, Licheng Zhang +4
On the Calibration of Large Language Models and Alignment
Chiwei Zhu, Benfeng Xu, Quan Wang +2
UniRel: Unified Representation and Interaction for Joint Relational Triple Extraction
Wei Tang, Benfeng Xu, Yuyue Zhao +4
Building Chinese Biomedical Language Models via Multi-Level Text Discrimination
Quan Wang, Songtai Dai, Benfeng Xu +4
A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval Interfaces
Mingxuan Du, Benfeng Xu, Chiwei Zhu +4
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
Mingxuan Du, Benfeng Xu, Chiwei Zhu +2
MIRROR: Multi-agent Intra- and Inter-Reflection for Optimized Reasoning in Tool Learning
Zikang Guo, Benfeng Xu, Xiaorui Wang +1
Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability
Chiwei Zhu, Benfeng Xu, An Yang +4
BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms
Pengyu Wang, Benfeng Xu, Shaohan Wang +5
The paper conducts a controlled scaling study of various retrieval-augmented generation methods and finds that BM25 becomes the most accurate and cost‑effective approach once the c…
Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluation
Yuhang Zhu, Mingxuan Du, Benfeng Xu +3
The paper presents PALATE, a benchmark that uses per‑user simulated agents to evaluate role‑playing language models through free‑form, multi‑turn conversations and personalized sat…
An Index-based Approach for Efficient and Effective Web Content Extraction
Yihan Chen, Benfeng Xu, Xiaorui Wang +1
ExpertPrompting: Instructing Large Language Models to be Distinguished Experts
Benfeng Xu, An Yang, Junyang Lin +4
From Real to Synthetic: Synthesizing Millions of Diversified and Complicated User Instructions with Attributed Grounding
Chiwei Zhu, Benfeng Xu, Xiaorui Wang +1
Automated Creativity Evaluation for Large Language Models: A Reference-Based Approach
Ruizhe Li, Chiwei Zhu, Benfeng Xu +2