Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
Business Arena: Benchmarking LLM Agents in a Realistic Marketplace
Yijun Pan, Yukun Lian, Kunyu Shi +5
Running a business is a challenging form of intelligent work. Operators must infer opportunities from partial signals, commit capital under uncertainty, adapt to delayed outcomes i…
cs.AI2025
Hybrid Reward Normalization for Process-supervised Non-verifiable Agentic Tasks
Peiran Xu, Zhuohao Li, Xiaoying Xing +3
Large Language Models (LLMs) increasingly rely on external tools such as search engines to solve complex agentic tasks that require reasoning and external knowledge retrieval. Rece…