7 papers
Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks
Youting Wang, Xiao Han, Dingyan Shang +2
Agent-safety benchmarks measure different behaviors, and their scores get quoted interchangeably as an agent's safety. We treat four of them (R-Judge, InjecAgent, AgentHarm, AgentD…
Teach-to-Reason: Competition-Guided Reasoning with a Self-Improving Teacher
Xiao Han, Hao Liu, Zhimin Bao +5
Chest X-ray visual question answering (CXR VQA) requires models not only to predict correct answers, but also to produce reliable medical reasoning. However, existing reinforcement…
Towards Pareto-Optimal Tool-Integrated Agents with Pareto Ranking Policy Optimization
Junyi Li, Xiaowei Qian, Yingyi Zhang +6
Recent advances in tool-integrated language agents have significantly improved their ability to solve complex reasoning tasks. However, existing alignment methods predominantly foc…
DynamicPTQ: Mitigating Activation Quantization Collapse via Residual-Stream Dynamics
Zimo Zhao, Maolin Wang, Bowen Yu +3
Post-training quantization (PTQ) is essential for efficient large language model inference, but reliably quantizing activations remains challenging when weights, activations, and K…
BlossomRec: Block-level Fused Sparse Attention Mechanism for Sequential Recommendations
Mengyang Ma, Xiaopeng Li, Wanyu Wang +9
Transformer structures have been widely used in sequential recommender systems (SRS). However, as user interaction histories increase, computational time and memory requirements al…
SEARCH-R: Structured Entity-Aware Retrieval with Chain-of-Reasoning Navigator for Multi-hop Question Answering
Yuqing Fu, Yimin Deng, Wanyu Wang +9
Multi-hop Question Answering (MHQA) aims to answer questions that require multi-step reasoning. It presents two key challenges: generating correct reasoning paths in response to th…