2 papers
cs.SE2026
ExecuCritic: Calibrated Critic Shaping for Code Generation with Verifiable Rewards
Junjie Cao, Yingjie He
Execution feedback is a useful supervision signal for code models because unit tests are objective and directly measure program correctness. Its weakness is that an entire program…
cs.CV2026
SAVOR: Self-Aware Visual Grounding via Confidence-Calibrated Reinforcement Learning for Multimodal Hallucination Mitigation
Zixiu Ding, Zilin Zhao, Yingjie He +3
Multimodal large language models (MLLMs) have made strong progress on visual question answering and image captioning, yet they still produce fluent claims about objects, attributes…