2 papers
cs.CV2026
Hybrid Transformer-Mamba for Weakly Supervised Volumetric Medical Segmentation
Yiheng Lyu, Lian Xu, Coen Arrow +3
Weakly supervised segmentation enables model training from plane-level labels. Existing methods often rely on 2D encoders, neglecting the volumetric nature of medical data. We prop…
cs.CL2026
Watch and Listen: Understanding Audio-Visual-Speech Moments with Multimodal LLM
Zinuo Li, Xian Zhang, Yongxin Guo +5
Humans naturally understand moments in a video by integrating visual and auditory cues. For example, localizing a scene in the video like "A scientist passionately speaks on wildli…