2 papers
cs.CV2026
SkyVLaM: Multimodal Large Language Model for UAV Video Understanding in Remote Sensing
Kaiwen Jing, Ruixu Jia, Bingyao Li +3
Recent advances in Multimodal Large Language Models (MLLMs) have significantly improved remote sensing (RS) multimodal understanding. Language-conditioned segmentation is crucial f…
cs.CV2025
Enhancing Multi-task Learning Capability of Medical Generalist Foundation Model via Image-centric Multi-annotation Data
Xun Zhu, Fanbin Mo, Zheng Zhang +6
The emergence of medical generalist foundation models has revolutionized conventional task-specific model development paradigms, aiming to better handle multiple tasks through join…