2 papers
cs.CV2026
Hallucination Detection and Correction in Medical VLMs via Counter-Evidence Verification
Nan Zhou, Ke Zou, Meng Liu +5
Vision-Language models (VLMs) reliability in medical diagnosis is challenged by trust-undermining hallucinations. Existing hallucination detection approaches mainly focus on identi…
cs.CV2026
Improving Joint Audio-Video Generation with Cross-Modal Context Learning
Bingqi Ma, Linlong Lang, Ming Zhang +5
The dual-stream transformer architecture-based joint audio-video generation method has become the dominant paradigm in current research. By incorporating pre-trained video diffusio…