NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (27)

cs.CL2023

Self-Evolved Diverse Data Sampling for Efficient Instruction Tuning

Shengguang Wu, Keming Lu, Benfeng Xu +3

cs.CL2026

Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory

Ruizhe Li, Mingxuan Du, Benfeng Xu +1

cs.CL2021

Entity Structure Within and Throughout: Modeling Mention Dependencies for Document-Level Relation Extraction

Benfeng Xu, Quan Wang, Yajuan Lyu +2

cs.CL2025

Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking

Yihan Chen, Benfeng Xu, Xiaorui Wang +2

cs.CL2023

Qwen Technical Report

Jinze Bai, Shuai Bai, Yunfei Chu +45

cs.CL2026

SearchAttack: Red-Teaming LLMs against Knowledge-to-Action Threats under Online Web Search

Yu Yan, Sheng Sun, Mingfeng Li +6

cs.CL2026

Wiki Live Challenge: Challenging Deep Research Agents with Expert-Level Wikipedia Articles

Shaohan Wang, Benfeng Xu, Licheng Zhang +5

cs.CV2026

MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing

Jiajia Lin, Mingxuan Du, Tuowen Zhou +2

The paper presents MPIE-Bench, a benchmark of 2,500 multi-person interaction editing examples, and MPIE-Eval, an evaluation method that uses mesh reconstruction to assess anatomica…

#multi-person interaction#image editing#benchmark#mesh reconstruction
cs.CL2023

$k$NN Prompting: Beyond-Context Learning with Calibration-Free Nearest Neighbor Inference

Benfeng Xu, Quan Wang, Zhendong Mao +3

cs.CL2026

FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents

Chiwei Zhu, Benfeng Xu, Mingxuan Du +4

cs.CL2026

DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report

Ruizhe Li, Mingxuan Du, Benfeng Xu +3

cs.CL2025

MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools

Zikang Guo, Benfeng Xu, Chiwei Zhu +3

cs.CL2024

Benchmarking Large Language Models on Controllable Generation under Diversified Instructions

Yihan Chen, Benfeng Xu, Quan Wang +2

cs.CL2026

WildGraphBench: Benchmarking GraphRAG with Wild-Source Corpora

Pengyu Wang, Benfeng Xu, Licheng Zhang +4

cs.CL2023

On the Calibration of Large Language Models and Alignment

Chiwei Zhu, Benfeng Xu, Quan Wang +2

cs.CL2022

UniRel: Unified Representation and Interaction for Joint Relational Triple Extraction

Wei Tang, Benfeng Xu, Yuyue Zhao +4

cs.CL2022

Building Chinese Biomedical Language Models via Multi-Level Text Discrimination

Quan Wang, Songtai Dai, Benfeng Xu +4

cs.CL2026

A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval Interfaces

Mingxuan Du, Benfeng Xu, Chiwei Zhu +4

cs.CL2025

DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents

Mingxuan Du, Benfeng Xu, Chiwei Zhu +2

cs.AI2025

MIRROR: Multi-agent Intra- and Inter-Reflection for Optimized Reasoning in Tool Learning

Zikang Guo, Benfeng Xu, Xiaorui Wang +1

cs.CL2025

Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability

Chiwei Zhu, Benfeng Xu, An Yang +4

cs.CL2026

BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

Pengyu Wang, Benfeng Xu, Shaohan Wang +5

The paper conducts a controlled scaling study of various retrieval-augmented generation methods and finds that BM25 becomes the most accurate and cost‑effective approach once the c…

#retrieval-augmented generation#scaling study#lexical retrieval#dense retrieval
cs.CL2026

Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluation

Yuhang Zhu, Mingxuan Du, Benfeng Xu +3

The paper presents PALATE, a benchmark that uses per‑user simulated agents to evaluate role‑playing language models through free‑form, multi‑turn conversations and personalized sat…

#role-playing agents#user simulation#evaluation benchmark#large language models
cs.IR2025

An Index-based Approach for Efficient and Effective Web Content Extraction

Yihan Chen, Benfeng Xu, Xiaorui Wang +1

cs.CL2025

ExpertPrompting: Instructing Large Language Models to be Distinguished Experts

Benfeng Xu, An Yang, Junyang Lin +4

cs.CL2025

From Real to Synthetic: Synthesizing Millions of Diversified and Complicated User Instructions with Attributed Grounding

Chiwei Zhu, Benfeng Xu, Xiaorui Wang +1

cs.CL2025

Automated Creativity Evaluation for Large Language Models: A Reference-Based Approach

Ruizhe Li, Chiwei Zhu, Benfeng Xu +2