2 papers
cs.AI2026
From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning
Shaojie Wang, Liang Zhang
Current LLM post-training methods optimize complete reasoning trajectories through Supervised Fine-Tuning (SFT) followed by outcome-based Reinforcement Learning (RL). While effecti…
cs.CL2026
From Implicit to Explicit: Token-Efficient Logical Supervision for Mathematical Reasoning in LLMs
Shaojie Wang, Liang Zhang
Recent studies reveal that large language models (LLMs) exhibit limited logical reasoning abilities in mathematical problem-solving, instead often relying on pattern-matching and m…