distributed execution 1GPU memory efficiency 1large language model training 1long-context reinforcement learning 1policy optimization 1
From the 1 of 10 linked papers with an AI index.
Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
CoT-X: An Adaptive Framework for Cross-Model Chain-of-Thought Transfer and Optimization
Ziqian Bi, Yinzhi Wang, Tianyang Wang +6
Long Chain-of-Thought (CoT) traces can improve reasoning accuracy, but repeatedly generating them is costly for smaller or latency-constrained language models. This paper studies a…
cs.AI2026
STRIDE: Strategic Trajectory Reasoning via Discriminative Estimation for Verifiable Reinforcement Learning
Qinjian Zhao, Zhihao Dou, Dinggen Zhang +10
Reinforcement Learning with Verifiable Rewards (RLVR) has become an effective post-training paradigm for improving the reasoning abilities of large language models. However, existi…