1 paper · 1 filter
Junseok Lee, Sangyong Lee, Chang-Jae Chun
Scaling Multimodal Large Language Models (MLLMs) to long-form speech is bottlenecked by the explosive growth of input tokens. Unlike images or videos, audio lacks overlapping infor…