3 papers
cs.CL2026
Process Rewards with Learned Reliability
Jinyuan Li, Langlin Huang, Chengsong Huang +5
Process Reward Models (PRMs) provide step-level feedback for reasoning, but current PRMs usually output only a single reward score for each step. Downstream methods must therefore…
cs.AI2026
Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration
Langlin Huang, Chengsong Huang, Jinyuan Li +3
Reinforcement learning with verifiable rewards, particularly Group Relative Policy Optimization (GRPO), has significantly advanced the reasoning capabilities of Large Language Mode…
cs.IR2025
Use of Retrieval-Augmented Large Language Model Agent for Long-Form COVID-19 Fact-Checking
Jingyi Huang, Yuyi Yang, Mengmeng Ji +3
The COVID-19 infodemic calls for scalable fact-checking solutions that handle long-form misinformation with accuracy and reliability. This study presents SAFE (system for accurate…