2 papers
cs.CV2026
LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition
Jiajun Cheng, Subarna Tripathi, Sainan Liu +2
Understanding instrument-tissue interactions is essential for context-aware surgical AI and autonomous robotic surgery. Pretrained vision-language models (VLMs) and vision encoders…
cs.CV2026
TrajPred: Trajectory-Conditioned Joint Embedding Prediction for Surgical Instrument-Tissue Interaction Recognition in Vision-Language Models
Jiajun Cheng, Xiaofan Yu, Subarna Tripathi +2
Recognizing instruments' interactions with tissues is essential for building context-aware AI assistants in robotic surgery. Vision-language models (VLMs) have opened a new avenue…