1 paper · 1 filter
Minping Chen, Bowen Xiao, Du Liang +2
Reinforcement learning (RL) for large language models (LLMs) is highly sensitive to hyperparameter configurations, making hyperparameter optimization (HPO) essential yet computatio…