1 paper · 1 filter
Nikhil Verma, Minjung Kim, JooYoung Yoo +5
Multimodal language models now integrate text, audio, and video for unified reasoning. Yet existing RL post-training pipelines treat all input signals as equally relevant, ignoring…