2 papers
cs.LG2026
Reinforcement Learning with Promising Tokens for Large Language Models
Jing-Cheng Pang, Liang Lu, Xian Tang +4
Reinforcement learning (RL) has emerged as a key paradigm for aligning and optimizing large language models (LLMs). Standard approaches treat the LLM as the policy and apply RL dir…
cs.LG2026
EDCO: Dynamic Curriculum Orchestration for Domain-specific Large Language Model Fine-tuning
Jing-Cheng Pang, Liu Sun, Chang Zhou +10
Domain-specific large language models (LLMs), typically developed by fine-tuning a pre-trained general-purpose LLM on specialized datasets, represent a significant advancement in a…