3 papers
cs.CL2026
ProcArena: A Multi-Scenario Benchmark for LLMs on Direct and Interactive PL/SQL Development from Natural Language
Hang Zhang, Chaokun Wang, Yuzhi Pan +12
Large language models (LLMs) have shown strong potential for translating natural-language (NL) requirements into PL/SQL programs, attracting increasing attention from the database…
cs.LG2026
Gradients Know What Outcomes Don't: Unlocking Reinforcement Learning for LLM Reasoning with Gradient-Aligned Rewards
Leqi Zheng, Jinbo Su, Fang Niu +8
Reinforcement learning from verifiable rewards (RLVR) drives chain-of-thought reasoning in large language models, yet its binary outcome reward cannot distinguish among correct tra…
cs.IR2026
SciLENS: RL-Driven Autonomous Agents for Scientific Localized Evidence Navigation and Synthesis
Leqi Zheng, Jinbo Su, Yuying Li +10
Scientific literature synthesis agents increasingly rely on proprietary online services, limiting reproducibility, privacy, and offline deployment. To address this challenge, we in…