3 papers
cs.LG2026
Gradients Know What Outcomes Don't: Unlocking Reinforcement Learning for LLM Reasoning with Gradient-Aligned Rewards
Leqi Zheng, Jinbo Su, Fang Niu +8
Reinforcement learning from verifiable rewards (RLVR) drives chain-of-thought reasoning in large language models, yet its binary outcome reward cannot distinguish among correct tra…
cs.IR2026
SciLENS: RL-Driven Autonomous Agents for Scientific Localized Evidence Navigation and Synthesis
Leqi Zheng, Jinbo Su, Yuying Li +10
Scientific literature synthesis agents increasingly rely on proprietary online services, limiting reproducibility, privacy, and offline deployment. To address this challenge, we in…
cs.CL2026
SkillForge: Compositional Skill Synthesis with Verification-in-the-Loop for Generating Formally Verified Dafny Programs
Yanming Liu, Xinyue Peng, Jiannan Cao +2
Generating formally verified programs from natural language remains challenging: existing approaches either produce code in a single pass without recourse when verification fails,…