3 papers
cs.RO2024
Robotic-CLIP: Fine-tuning CLIP on Action Data for Robotic Applications
Nghia Nguyen, Minh Nhat Vu, Tung D. Ta +4
Vision language models have played a key role in extracting meaningful features for various robotic applications. Among these, Contrastive Language-Image Pretraining (CLIP) is wide…
cs.RO2024
GraspMamba: A Mamba-based Language-driven Grasp Detection Framework with Hierarchical Feature Learning
Huy Hoang Nguyen, An Vuong, Anh Nguyen +2
Grasp detection is a fundamental robotic task critical to the success of many industrial applications. However, current language-driven models for this task often struggle with clu…
cs.CV2024
CathAction: A Benchmark for Endovascular Intervention Understanding
Baoru Huang, Tuan Vo, Chayun Kongtongvattana +35
Real-time visual feedback from catheterization analysis is crucial for enhancing surgical safety and efficiency during endovascular interventions. However, existing datasets are of…