cliff prompts 1low-rank adaptation 1mathematical reasoning 1policy optimization 1reinforcement learning 1
From the 1 of 3 linked papers with an AI index.
3 papers
cs.LG2026
LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts
Ken Ding
The paper introduces LoRA Scaffolded Policy Optimization (LSPO), a sampling-time low-rank adapter method that recovers gradient information for reinforcement learning on difficult…
cs.LG2026
HDPO: Hybrid Distillation Policy Optimization via Privileged Self-Distillation
Ken Ding
Large language models trained with reinforcement learning (RL) for mathematical reasoning face a fundamental challenge: on problems the model cannot solve at all - "cliff" prompts…
cs.LG2025
Breaking Memorization Barriers in LLM Code Fine-Tuning via Information Bottleneck for Improved Generalization
Changsheng Wang, Xin Chen, Sijia Liu +1
Adapting pretrained large language models (LLMs) to code domains via supervised fine-tuning (FT) has been commonly used for code generation. However, we identify a previously under…