collaborators

5 papers

cs.LG2026

FAPO: Flawed-Aware Policy Optimization for Efficient and Reliable Reasoning

Yuyang Ding, Chi Zhang, Juntao Li +2

Reinforcement learning with verifiable rewards (RLVR) has emerged as a promising paradigm for enhancing the reasoning capabilities of large language models (LLMs). In this context,…

cs.LG2025

SCAN: Self-Denoising Monte Carlo Annotation for Robust Process Reward Learning

Yuyang Ding, Xinyu Shi, Juntao Li +3

Process reward models (PRMs) offer fine-grained, step-level evaluations that facilitate deeper reasoning processes in large language models (LLMs), proving effective in complex tas…

cs.CL2025

Unleashing LLM Reasoning Capability via Scalable Question Synthesis from Scratch

Yuyang Ding, Xinyu Shi, Xiaobo Liang +4

Improving the mathematical reasoning capabilities of Large Language Models (LLMs) is critical for advancing artificial intelligence. However, access to extensive, diverse, and high…

cs.CL2025

Towards DS-NER: Unveiling and Addressing Latent Noise in Distant Annotations

Yuyang Ding, Dan Qiao, Juntao Li +4

Distantly supervised named entity recognition (DS-NER) has emerged as a cheap and convenient alternative to traditional human annotation methods, enabling the automatic generation…

cs.AI2025

A Survey of Slow Thinking-based Reasoning LLMs using Reinforced Learning and Inference-time Scaling Law

Qianjun Pan, Wenkai Ji, Yuyang Ding +8

This survey explores recent advancements in reasoning large language models (LLMs) designed to mimic "slow thinking" - a reasoning process inspired by human cognition, as described…