3 papers
cs.AI2026
PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs
Dayang Liang, Liyuan He, Xuan Feng +3
Group-relative policy optimization has emerged as a key paradigm for training agentic large language models (LLMs) on multi-turn interactive tasks. However, most existing variants…
cs.RO2026
InterReal: A Unified Physics-Based Imitation Framework for Learning Human-Object Interaction Skills
Dayang Liang, Yuhang Lin, Xinzhe Liu +3
Interaction is one of the core abilities of humanoid robots. However, most existing frameworks focus on non-interactive whole-body control, which limits their practical applicabili…
cs.AI2026
Task-Aware Exploration via a Predictive Bisimulation Metric
Dayang Liang, Ruihan Liu, Lipeng Wan +2
Accelerating exploration in visual reinforcement learning under sparse rewards remains challenging due to the substantial task-irrelevant variations. Despite advances in intrinsic…