3 papers
cs.RO2026
SAVLA: Symmetry-Aware Vision-Language-Action Models for Robotic Manipulation
Junle Li, Weixian Waylon Li, Fuxiang Wu +2
Vision-language-action (VLA) models have become the dominant paradigm for language-conditioned robot manipulation. However, although images and language instructions inherently enc…
cs.CV2026
IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning
Chenghao Li, Fusheng Hao, Xikai Zhang +5
Multimodal large language models via reinforcement learning (RL) have demonstrated remarkable capabilities in complex visual reasoning tasks, yet they remain limited in long-horizo…
cs.LG2025
Gradient-based Fine-Tuning through Pre-trained Model Regularization
Xuanbo Liu, Liu Liu, Fuxiang Wu +2
Large pre-trained models have demonstrated extensive applications across various fields. However, fine-tuning these models for specific downstream tasks demands significant computa…