3 papers
cs.CV2026
LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition
Jiajun Cheng, Subarna Tripathi, Sainan Liu +2
Understanding instrument-tissue interactions is essential for context-aware surgical AI and autonomous robotic surgery. Pretrained vision-language models (VLMs) and vision encoders…
cs.CV2026
SurgXBench: Explainable Vision-Language Model Benchmark for Surgery
Jiajun Cheng, Xianwu Zhao, Sainan Liu +5
Innovations in digital intelligence are transforming robotic surgery with more informed decision-making. Real-time awareness of surgical instrument presence and actions (e.g., cutt…
cs.CV2026
TrajPred: Trajectory-Conditioned Joint Embedding Prediction for Surgical Instrument-Tissue Interaction Recognition in Vision-Language Models
Jiajun Cheng, Xiaofan Yu, Subarna Tripathi +2
Recognizing instruments' interactions with tissues is essential for building context-aware AI assistants in robotic surgery. Vision-language models (VLMs) have opened a new avenue…