2 papers
cs.CV2026
Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models
Sujung Hong, Chanyong Yoon, Seong Jae Hwang
Large diffusion vision-language models (LDVLMs) have recently emerged as a promising alternative to autoregressive models, enabling parallel decoding for efficient inference and le…
cs.CV2025
Mono-Modalizing Extremely Heterogeneous Multi-Modal Medical Image Registration
Kyobin Choo, Hyunkyung Han, Jinyeong Kim +2
In clinical practice, imaging modalities with functional characteristics, such as positron emission tomography (PET) and fractional anisotropy (FA), are often aligned with a struct…