7 papers
SurgWMBench: A Vision-Based Benchmark for World-Modeling Surgical Instrument Motion Planning
Huanrong Liu, Weiliang Huang, Bob Zhang +3
Reliable surgical planning requires models that move beyond recognizing the current surgical step or imitating expert demonstrations, and instead anticipate how instrument motion r…
Implicit Virtual Leader: Decentralized Vision-Only Relative Pose Estimation for Multi-Robot Formations
Shiyuan Yang, Zelin Wang, Zhijia Tao +8
Classical leader-follower formation control suffers from single points of failure and error propagation, and relies on absolute localization sensors that are ill-suited for GPS-den…
FabriVLA: A Lightweight Vision-Language-Action Model with Conformal Action Chunk Uncertainty
Shiyuan Yang, Borong Zhang, Jizheng Zhang +5
Vision-Language-Action (VLA) models have become a leading paradigm for general purpose robotic manipulation, but their computational cost and limited uncertainty awareness hinder p…
SutureFormer: Learning Surgical Trajectories via Goal-conditioned Offline RL in Pixel Space
Huanrong Liu, Chunlin Tian, Tongyu Jia +8
Predicting surgical needle trajectories from endoscopic video is critical for robot-assisted suturing, enabling anticipatory planning, real-time guidance, and safer motion executio…
Fine-Grained Action Segmentation for Renorrhaphy in Robot-Assisted Partial Nephrectomy
Jiaheng Dai, Huanrong Liu, Tailai Zhou +7
Fine-grained action segmentation during renorrhaphy in robot-assisted partial nephrectomy requires frame-level recognition of visually similar suturing gestures with variable durat…
120 Minutes and a Laptop: Minimalist Image-goal Navigation via Unsupervised Exploration and Offline RL
Xiaoming Liu, Borong Zhang, Qingbiao Li +1
The prevailing paradigm for image-goal visual navigation often assumes access to large-scale datasets, substantial pretraining, and significant computational resources. In this wor…