1 paper · 1 filter
Kangjia Zhao, Jiajun Li, Haozhan Shen +8
Multi-turn tool calling is a core evaluation scenario for large language model (LLM) agents. On public tool-calling benchmarks, open-weight models now approach or even surpass clos…