7 papers
Woodpecker Distillation: Weak Models Diagnose Reasoning Bugs in Strong Models
Dayu Wang, Jiaye Yang, Weikang Li +4
Large language models often fail on reasoning tasks despite possessing the capability to solve them. We argue that many such failures arise from localized reasoning bugs in interme…
It Takes 8 Tokens: Weak-to-Strong Off-Policy RL via Auxiliary Branches
Dayu Wang, Jiaye Yang, Weikang Li +4
Reinforcement learning with verifiable rewards has emerged as a standard approach for enhancing reasoning in large language models, which typically optimizes the policy by contrast…
Student Guides Teacher: Weak-to-Strong Inference via Spectral Orthogonal Exploration
Dayu Wang, Jiaye Yang, Weikang Li +4
Large Language Models (LLMs) often suffer from ''Reasoning Collapse'' on challenging mathematical reasoning tasks, where stochastic sampling produces lexical variations of the same…
InjectFlow: Weak Guides Strong via Orthogonal Injection for Flow Matching
Dayu Wang, Jiaye Yang, Weikang Li +2
Flow Matching (FM) has recently emerged as a leading approach for high-fidelity visual generation, offering a robust continuous-time alternative to ordinary differential equation (…
Beyond Alignment: Expanding Reasoning Capacity via Manifold-Reshaping Policy Optimization
Dayu Wang, Jiaye Yang, Weikang Li +2
Reinforcement Learning with Verifiable Rewards (RLVR) has demonstrated remarkable success in enhancing the reasoning capabilities of Large Language Models (LLMs). However, recent s…
Reducing Cognitive Overhead in Tool Use via Multi-Small-Agent Reinforcement Learning
Dayu Wang, Jiaye Yang, Weikang Li +2
Recent advances in multi-agent systems highlight the potential of specialized small agents that collaborate via division of labor. Existing tool-integrated reasoning systems, howev…