2 papers
cs.CV2026
PixVL: Self-Supervised Training of Pixel-Level MLLMs via a Unified Mask--Text Consistency Cycle
Yicheng Xiao, Haoxuan Ma, Caorui Li +7
Recent studies develop pixel-level multimodal large language models (MLLMs) that support both Region Segmentation and Region Understanding, extending multimodal interaction from wh…
cs.MM2026
CARA: Concept-Aware Risk Attention for Interpretable Collision Anticipation
Zhishan Tao, Ruoyu Wang, Yucheng Wu +6
Collision anticipation in autonomous driving requires not only accurate early warnings but also interpretable reasoning about what risk factors are being tracked and how risk evolv…