1 paper
Minping Chen, Bowen Xiao, Du Liang +2
Reinforcement learning (RL) for large language models (LLMs) is highly sensitive to hyperparameter configurations, making hyperparameter optimization (HPO) essential yet computatio…