2 papers
cs.LG2026
How Reasoning Evolves from Post-Training Data: An Empirical Study Using Chess
Lucas Dionisopoulos, Nicklas Majamaki, Prithviraj Ammanabrolu
We study how reasoning evolves in a language model -- from supervised fine-tuning (SFT) to reinforcement learning (RL) -- by analyzing how a set of theoretically-inspired datasets…
cs.LG2026
LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning
Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang +4
Large Language Models (LLMs) demonstrate their reasoning ability through chain-of-thought (CoT) generation. However, LLM's autoregressive decoding may limit the ability to revisit…