1 paper
Koen P. de Vries, Xavier Alameda-Pineda, Estefanía Talavera +1
Training Multimodal Large Language Models for audio-visual social understanding is a crucial step toward embodied social intelligence. Chain-of-thought (CoT) reasoning has become t…