1 paper
Ming Yang, Xiaofan Li, Zhiyuan Ma +4
Recent curriculum reinforcement learning for large language models (LLMs) typically rely on difficulty-based annotations for data filtering and ordering. However, such methods suff…