4 papers
Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation
Xue Liu, Xin Ma, Yuxin Ma +36
As Large Language Models (LLMs) exhibit plateauing performance on conventional benchmarks, a pivotal challenge persists: evaluating their proficiency in complex, open-ended tasks c…
Adaptive Memory Admission Control for LLM Agents
Guilin Zhang, Wei Jiang, Xiejiashan Wang +5
LLM-based agents increasingly rely on long-term memory to support multi-session reasoning and interaction, yet current systems provide little control over what information is retai…
LLMs as Orchestrators: Constraint-Compliant Multi-Agent Optimization for Recommendation Systems
Guilin Zhang, Kai Zhao, Jeffrey Friedman +1
Recommendation systems must optimize multiple objectives while satisfying hard business constraints such as fairness and coverage. For example, an e-commerce platform may require e…
RobustExplain: Evaluating Robustness of LLM-Based Explanation Agents for Recommendation
Guilin Zhang, Kai Zhao, Jeffrey Friedman +1
Large Language Models (LLMs) are increasingly used to generate natural-language explanations in recommender systems, acting as explanation agents that reason over user behavior his…