2 papers
cs.RO2026
Resilience Matters for Embodied Agents System: New Metrics, Systematic Evaluation, and Optimization
Yapeng Liu, Yuanzhao Zhai, Xudong Gong +4
Embodied Agents System (EAS) are increasingly deployed in open-world physical domains, where reliability directly dictates deployment quality and human-agent trust. However, existi…
cs.AI2026
Beyond Scores: Diagnostic LLM Evaluation via Fine-Grained Abilities
Xu Zhang, Xudong Gong, Jiacheng Qin +5
Current evaluations of large language models aggregate performance across diverse tasks into single scores. This obscures fine-grained ability variation, limiting targeted model im…