1 paper
Lingxiao Kong, Cong Yang, Susanne Neufang +2
Recent advances in reinforcement learning (RL) for large language model (LLM) fine-tuning show promise in addressing multi-objective tasks but still face significant challenges, in…