activity
20242026
collaborators

6 papers

cs.CV2026

Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis

Yang Yu, Dunyuan Xu, Yaoqian Li +3

3D medical image analysis is of great importance in disease diagnosis and treatment. Recently, multimodal large language models (MLLMs) have exhibited robust perceptual capacity, s…

cs.CV2026

Med-Evo: Test-time Self-evolution for Medical Multimodal Large Language Models

Dunyuan Xu, Xikai Yang, Juzheng Miao +3

Medical Multimodal Large Language Models (MLLMs) have demonstrated remarkable capabilities across diverse healthcare tasks. However, current post-training strategies, such as super…

cs.CV2025

Perceive and Calibrate: Analyzing and Enhancing Robustness of Medical Multi-Modal Large Language Models

Dunyuan XU, Xikai Yang, Yaoqian Li +3

Medical Multi-modal Large Language Models (MLLMs) have shown promising clinical performance. However, their sensitivity to real-world input perturbations, such as imaging artifacts…

q-bio.OT2025

SurgPub-Video: A Comprehensive Surgical Video Dataset for Enhanced Surgical Intelligence in Vision-Language Model

Yaoqian Li, Xikai Yang, Dunyuan Xu +5

Vision-Language Models (VLMs) have shown significant potential in surgical scene analysis, yet existing models are limited by frame-level datasets and lack high-quality video data…

cs.CV2025

From Learning to Unlearning: Biomedical Security Protection in Multimodal Large Language Models

Dunyuan Xu, Xikai Yang, Yaoqian Li +2

The security of biomedical Multimodal Large Language Models (MLLMs) has attracted increasing attention. However, training samples easily contain private information and incorrect k…

cs.CV2024

Depth-Driven Geometric Prompt Learning for Laparoscopic Liver Landmark Detection

Jialun Pei, Ruize Cui, Yaoqian Li +3

Laparoscopic liver surgery poses a complex intraoperative dynamic environment for surgeons, where remains a significant challenge to distinguish critical or even hidden structures…