2 papers
cs.CV2025
Multimodal Reference Visual Grounding
Yangxiao Lu, Ruosen Li, Liqiang Jing +5
Visual grounding focuses on detecting objects from images based on language expressions. Recent Large Vision-Language Models (LVLMs) have significantly advanced visual grounding pe…
cs.RO2024
iTeach: In the Wild Interactive Teaching for Failure-Driven Adaptation of Robot Perception
Jishnu Jaykumar P, Cole Salvato, Vinaya Bomnale +2
Robotic perception models often fail when deployed in real-world environments due to out-of-distribution conditions such as clutter, occlusion, and novel object instances. Existing…