papers

Publications (27)

cs.LG2026

Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information

Guobin Shen, Xiang Cheng, Chenxiao Zhao +4

physics.optics2011

Metallic helix array as a broadband wave plate

Chao Wu, Hongqiang Li, Xing Yu +3

cond-mat.mtrl-sci2023

Electron doping induced stable ferromagnetism in two-dimensional GdI_3 monolayer

Rong Guo, Yilv Guo, Yehui Zhang +5

cs.LG2026

VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training

Guobin Shen, Chenxiao Zhao, Xiang Cheng +2

cs.CV2026

DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning

Ziwei Zheng, Michael Yang, Jack Hong +5

cs.CL2026

Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation

Yanjiang Liu, Jie Lou, Xinyan Guan +7

cs.CL2026

Bootstrapping Exploration with Group-Level Natural Language Feedback in Reinforcement Learning

Lei Huang, Xiang Cheng, Chenxiao Zhao +6

cs.LG2025

Rethinking Reward Model Evaluation: Are We Barking up the Wrong Tree?

Xueru Wen, Jie Lou, Yaojie Lu +7

cs.AI2026

Scalable Oversight for Superhuman AI via Recursive Self-Critiquing

Xueru Wen, Jie Lou, Xinyu Lu +5

cs.CV2026

DeepEyesV2: Toward Agentic Multimodal Model

Jack Hong, Chenxiao Zhao, ChengLin Zhu +3

physics.optics2011

An ultra-thin waveguide twist constructed using fish-scale metallic wires

Jin Han, Hongqiang Li, Yuancheng Fan +6

cs.CV2025

The System Description of CPS Team for Track on Driving with Language of CVPR 2024 Autonomous Grand Challenge

Jinghan Peng, Jingwen Wang, Xing Yu +1

physics.ao-ph2023

Machine Learning Parameterization of the Multi-scale Kain-Fritsch (MSKF) Convection Scheme

Xiaohui Zhong, Xing Yu, Hao Li

cs.CL2026

Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards

Mengjie Ren, Jie Lou, Boxi Cao +6

cs.AI2026

REDSearcher: A Scalable and Cost-Efficient Framework for Long-Horizon Search Agents

Zheng Chu, Xiao Wang, Jack Hong +11

cs.CL2025

Cheems: A Practical Guidance for Building and Evaluating Chinese Reward Models from Scratch

Xueru Wen, Jie Lou, Zichao Li +9

physics.optics2011

Subwavelength electromagnetic diode: one-way response of cascading nonlinear meta-atoms

Yuancheng Fan, Jin Han, Zeyong Wei +4

cs.LG2026

From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation

Guobin Shen, Lei Huang, Xiang Cheng +4

cs.AI2025

Towards Agentic Self-Learning LLMs in Search Environment

Wangtao Sun, Xiang Cheng, Jialin Fan +5

cs.CL2025

LLMSR@XLLM25: Less is More: Enhancing Structured Multi-Agent Reasoning via Quality-Guided Distillation

Jiahao Yuan, Xingzhe Sun, Xing Yu +4

cs.CL2025

Think When You Need: Self-Adaptive Chain-of-Thought Learning

Junjie Yang, Ke Lin, Xing Yu

nlin.PS2020

Propagation dynamics of abruptly autofocusing circular Airy-Gaussian vortex beams in the fractional Schrödinger equation

Shangling He, Boris A. Malomed, Dumitru Mihalache +4

physics.optics2011

Broadband enhanced transmission through the stacked metallic multi-layers perforated with coaxial annular apertures

Zeyong Wei, Yang Cao, Yuancheng Fan +2

cs.CV2026

Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

Qianhao Yuan, Jie Lou, Xing Yu +4

cs.LG2026

Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning

Zichao Li, Jie Lou, Fangchen Dong +8

cs.LG2025

Probabilistic Uncertain Reward Model

Wangtao Sun, Xiang Cheng, Xing Yu +5

cs.SE2024

Risk Scenario Generation for Autonomous Driving Systems based on Causal Bayesian Networks

Jiangnan Zhao, Dehui Du, Xing Yu +1