2 papers
cs.AI2026
EcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM Agents
Jie Wu, Ming Gong, Feixiang Cheng +1
Agent benchmarks usually measure task completion and treat resource use as an auxiliary statistic. In deployment, however, the choice among a local lookup, broad search, composite…
cs.RO2026
Uncovering and Mitigating Positional Blind Spots in Vision-Language-Action Models
Dongdong An, Pengjie Zhao, Yihao Huang +5
Recent Vision-Language-Action (VLA) models achieve promising performance in robotic manipulation, typically measured by success rates aggregated over predefined object configuratio…