2 papers
cs.CV2026
MAD-HOI: Masked Autoregressive Diffusion for Generating Articulated Hand Object Interactions from Text
Ananya Bal, Kartik Sharma, Ethan Lai +4
Methods for text-based generation of hand-object interaction (HOI) sequences primarily focus on producing smooth, physically plausible trajectories. A truly utilitarian method shou…
cs.MM2025
MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX
Liuyue Xie, Avik Kuthiala, George Z. Wei +12
We introduce MAVERIX (Multimodal audiovisual Evaluation and Recognition IndeX), a unified benchmark to probe the video understanding in multimodal LLMs, encompassing video, audio,…