2 papers
cs.CV2026
LUT: Latent Utility Training for Visual Reasoning
Jiaxuan Kang, Siyu Chen, Mingda Li +6
Multimodal large language models have advanced visual understanding, yet perception-intensive reasoning remains challenging. Recent latent visual reasoning methods introduce hidden…
cs.GR2026
Learn2Chat: Rethinking Dyadic Talking Heads via Interaction-Modulated Monologic Priors
Zikai Huang, Siyue Chen, Xuemiao Xu +4
Dyadic conversational motion generation is essential for realistic interactive digital humans. Existing approaches typically model conversational behaviors within unified dyadic ge…