Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals
Bowen Qin, Yi Xie, Yesheng Liu +1
Language model-generated rubrics are increasingly used as reward signals for rubric-based reinforcement learning, LLM-as-a-judge evaluation, and automated grading. Such rubrics are…
cs.LG2026
TeamTR: Trust-Region Fine-Tuning for Multi-Agent LLM Coordination
Yi Xie, Siao Liu, Falong Fan +3
Multi-agent LLM systems have shown promise for complex reasoning, yet recent evaluations reveal they often underperform single-model baselines. We identify a structural failure mod…