Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
Difference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement Learning
Feiding, Yongkang Zhang, Yuhao Liao +10
Vision--language models (VLMs) are increasingly aligned via Group Relative Policy Optimization (GRPO)-style training. However, relying solely on terminal outcome rewards yields spa…
cs.CV2026
PoseStreamer: A Multi-modal Framework for 3D Tracking of Unseen Moving Objects
Huiming Yang, Linglin Liao, Fei Ding +2
Six degree of freedom (6DoF) pose estimation for novel objects is a critical task in computer vision, yet it faces significant challenges in high-speed and low-light scenarios wher…