4 papers · 1 filter
SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning
Dayang Liang, Lang Feng, Bo An +1
Agentic reinforcement learning (RL) has become a critical stage in the post-training of large language models. Existing critic-free, group-relative methods estimate policy advantag…
PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs
Dayang Liang, Liyuan He, Xuan Feng +3
Group-relative policy optimization has emerged as a key paradigm for training agentic large language models (LLMs) on multi-turn interactive tasks. However, most existing variants…
Task-Aware Exploration via a Predictive Bisimulation Metric
Dayang Liang, Ruihan Liu, Lipeng Wan +2
Accelerating exploration in visual reinforcement learning under sparse rewards remains challenging due to the substantial task-irrelevant variations. Despite advances in intrinsic…
Intrinsic Dynamics-Driven Generalizable Scene Representations for Vision-Oriented Decision-Making Applications
Dayang Liang, Jinyang Lai, Yunlong Liu
How to improve the ability of scene representation is a key issue in vision-oriented decision-making applications, and current approaches usually learn task-relevant state represen…