1 paper
Zhifeng Wang, Qixuan Zhang, Peter Zhang +5
Vision Large Language Models (VLLMs) exhibit promising potential for multi-modal understanding, yet their application to video-based emotion recognition remains limited by insuffic…