3 papers
cs.AI2026
Can the Environment Speak for Itself? -GRPO: A Turn-Trajectory Group Relative Policy Optimization for Caregiver Agents
Yutong Song, Jiang Wu, Pengfei Zhang +4
Optimizing large language models (LLMs) for long-horizon caregiver agents requires balancing delayed task objectives with immediate environment dynamics, such as patient distress a…
cs.RO2026
Effective Reinforcement Learning Control using Conservative Soft Actor-Critic
Zhiwei Shang, Xinyi Yuan, Wenjun Huang +3
Reinforcement Learning (RL) has shown great potential in complex control tasks, particularly when combined with deep neural networks within the Actor-Critic (AC) framework. However…
cs.RO2025
Multi-Goal Dexterous Hand Manipulation using Probabilistic Model-based Reinforcement Learning
Yingzhuo Jiang, Wenjun Huang, Rongdun Lin +3
This paper tackles the challenge of learning multi-goal dexterous hand manipulation tasks using model-based Reinforcement Learning. We propose Goal-Conditioned Probabilistic Model…