3 papers
cs.LG2026
Tool-Aware Optimization with Entropy Guidance for Efficient Agentic Reinforcement Learning
Hongye Cao, Nuo Yan, Haoyuan Deng +5
Agentic reinforcement learning (RL) equips large language models (LLMs) with tool-use capabilities that substantially improve reasoning on complex tasks. However, integrating exter…
cs.LG2025
Faster Game Solving via Asymmetry of Step Sizes
Linjian Meng, Tianpei Yang, Youzhi Zhang +2
Counterfactual Regret Minimization (CFR) algorithms are widely used to compute a Nash equilibrium (NE) in two-player zero-sum imperfect-information extensive-form games (IIGs). Amo…
cs.GT2025
Efficient Last-iterate Convergence Algorithms in Solving Games
Linjian Meng, Youzhi Zhang, Zhenxing Ge +6
To establish last-iterate convergence for Counterfactual Regret Minimization (CFR) algorithms in learning a Nash equilibrium (NE) of extensive-form games (EFGs), recent studies ref…