3 papers
cs.LG2025
Uncertainty-Guided Checkpoint Selection for Reinforcement Finetuning of Large Language Models
Manh Nguyen, Dung Nguyen, Dai Do +2
Reinforcement learning (RL) finetuning is crucial to aligning large language models (LLMs), but the process is notoriously unstable and exhibits high variance across model checkpoi…
cs.LG2025
SPaCe: Unlocking Sample-Efficient Large Language Models Training With Self-Pace Curriculum Learning
Dai Do, Manh Nguyen, Svetha Venkatesh +1
Large language models (LLMs) have shown strong reasoning capabilities when fine-tuned with reinforcement learning (RL). However, such methods require extensive data and compute, ma…
cs.LG2025
Reasoning Under 1 Billion: Memory-Augmented Reinforcement Learning for Large Language Models
Hung Le, Dai Do, Dung Nguyen +1
Recent advances in fine-tuning large language models (LLMs) with reinforcement learning (RL) have shown promising improvements in complex reasoning tasks, particularly when paired…