2 papers
cs.AI2026
TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents
Chengqi Dong, Chuhuai Yue, Hang He +6
We identify and formally characterize credit misassignment as a systematic failure mode of GRPO in tool-augmented multimodal search agents: its uniform broadcast of trajectory-leve…
cs.RO2021
Yaw-Guided Imitation Learning for Autonomous Driving in Urban Environments
Yandong Liu, Chengzhong Xu, Hui Kong
Existing imitation learning methods suffer from low efficiency and generalization ability when facing the road option problem in an urban environment. In this paper, we propose a y…