Publications (27)
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
Guobin Shen, Xiang Cheng, Chenxiao Zhao +4
Metallic helix array as a broadband wave plate
Chao Wu, Hongqiang Li, Xing Yu +3
Electron doping induced stable ferromagnetism in two-dimensional GdI_3 monolayer
Rong Guo, Yilv Guo, Yehui Zhang +5
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
Guobin Shen, Chenxiao Zhao, Xiang Cheng +2
DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
Ziwei Zheng, Michael Yang, Jack Hong +5
Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation
Yanjiang Liu, Jie Lou, Xinyan Guan +7
Bootstrapping Exploration with Group-Level Natural Language Feedback in Reinforcement Learning
Lei Huang, Xiang Cheng, Chenxiao Zhao +6
Rethinking Reward Model Evaluation: Are We Barking up the Wrong Tree?
Xueru Wen, Jie Lou, Yaojie Lu +7
Scalable Oversight for Superhuman AI via Recursive Self-Critiquing
Xueru Wen, Jie Lou, Xinyu Lu +5
DeepEyesV2: Toward Agentic Multimodal Model
Jack Hong, Chenxiao Zhao, ChengLin Zhu +3
An ultra-thin waveguide twist constructed using fish-scale metallic wires
Jin Han, Hongqiang Li, Yuancheng Fan +6
The System Description of CPS Team for Track on Driving with Language of CVPR 2024 Autonomous Grand Challenge
Jinghan Peng, Jingwen Wang, Xing Yu +1
Machine Learning Parameterization of the Multi-scale Kain-Fritsch (MSKF) Convection Scheme
Xiaohui Zhong, Xing Yu, Hao Li
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
Mengjie Ren, Jie Lou, Boxi Cao +6
REDSearcher: A Scalable and Cost-Efficient Framework for Long-Horizon Search Agents
Zheng Chu, Xiao Wang, Jack Hong +11
Cheems: A Practical Guidance for Building and Evaluating Chinese Reward Models from Scratch
Xueru Wen, Jie Lou, Zichao Li +9
Subwavelength electromagnetic diode: one-way response of cascading nonlinear meta-atoms
Yuancheng Fan, Jin Han, Zeyong Wei +4
From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation
Guobin Shen, Lei Huang, Xiang Cheng +4
Towards Agentic Self-Learning LLMs in Search Environment
Wangtao Sun, Xiang Cheng, Jialin Fan +5
LLMSR@XLLM25: Less is More: Enhancing Structured Multi-Agent Reasoning via Quality-Guided Distillation
Jiahao Yuan, Xingzhe Sun, Xing Yu +4
Think When You Need: Self-Adaptive Chain-of-Thought Learning
Junjie Yang, Ke Lin, Xing Yu
Propagation dynamics of abruptly autofocusing circular Airy-Gaussian vortex beams in the fractional Schrödinger equation
Shangling He, Boris A. Malomed, Dumitru Mihalache +4
Broadband enhanced transmission through the stacked metallic multi-layers perforated with coaxial annular apertures
Zeyong Wei, Yang Cao, Yuancheng Fan +2
Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation
Qianhao Yuan, Jie Lou, Xing Yu +4
Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning
Zichao Li, Jie Lou, Fangchen Dong +8
Probabilistic Uncertain Reward Model
Wangtao Sun, Xiang Cheng, Xing Yu +5
Risk Scenario Generation for Autonomous Driving Systems based on Causal Bayesian Networks
Jiangnan Zhao, Dehui Du, Xing Yu +1