collaborators

17 papers

cs.LG2026

RPO: Decoupling Rollout and Inference Policies for LLM Reasoning

Jingchu Wang, Bingbing Xu, Yige Yuan +4

Existing reinforcement learning methods for LLM reasoning implicitly assume that the policy generating training trajectories should coincide with the one producing inference respon…

cs.CL2026

GIFT: Games as Informal Training for Generalizable LLMs

Nuoyan Lyu, Bingbing Xu, Xueyun Tian +6

Recent LLMs excel at formal tasks such as mathematical reasoning and code generation, but still struggle with broader abilities such as planning, creativity, and social intelligenc…

cs.LG2026

Chain-of-Memory: Lightweight Memory Construction with Dynamic Evolution for LLM Agents

Xiucheng Xu, Bingbing Xu, Xueyun Tian +4

External memory systems are pivotal for enabling Large Language Model (LLM) agents to maintain persistent knowledge and perform long-horizon decision-making. Existing paradigms typ…

cs.AI2026

HAG: Hierarchical Demographic Tree-based Agent Generation for Topic-Adaptive Simulation

Rongxin Chen, Tianyu Wu, Bingbing Xu +3

High-fidelity agent initialization is crucial for credible Agent-Based Modeling across diverse domains. A robust framework should be Topic-Adaptive, capturing macro-level joint dis…

cs.CL2026

Inference-time Alignment in Continuous Space

Yige Yuan, Teng Xiao, Li Yunfan +5

Aligning large language models with human feedback at inference time has received increasing attention due to its flexibility. Existing methods rely on generating multiple response…

cs.CL2026

Incentivizing Strong Reasoning from Weak Supervision

Yige Yuan, Teng Xiao, Shuchang Tao +4

Large language models (LLMs) have demonstrated impressive performance on reasoning-intensive tasks, but enhancing their reasoning abilities typically relies on either reinforcement…