16 papers
LumiTokens: 3D Relighting via Token-Space Lighting Transformation
Yiwen Chen, Matheus Gadelha, Huaizu Jiang
Existing 3D relighting methods operate through either explicit material decomposition, diffusion-based view-space generation, or a combination of both, requiring full recomputation…
Surface Keypoint Representation for Multi-Object and Articulated Human-Object Interaction Generation
Xiaogang Peng, Zeyu Han, Zichong Meng +4
Daily activities require humans to coordinate whole-body motion with the motion of surrounding objects. Despite recent progress in human-object interaction (HOI) generation, most e…
Streaming Video Generation with Streaming Force Control
Hanhui Wang, Yiming Xie, Haiwen Feng +3
We introduce StreamForce, a streaming video generation framework that enables physically grounded control through continuous force inputs. Unlike prior video models that train sepa…
SocialFusion: Addressing Social Degradation in Pre-trained Vision-Language Models
Hamza Tahboub, Weiyan Shi, Gang Hua +1
Understanding social interactions from visual cues is a fundamental challenge for a socially competent AI. While powerful pre-trained vision-language models (VLMs) have shown remar…
LASER: Layer-wise Scale Alignment for Training-Free Streaming 4D Reconstruction
Tianye Ding, Yiming Xie, Yiqing Liang +3
Recent feed-forward reconstruction models like VGGT and achieve impressive reconstruction quality but cannot process streaming videos due to quadratic memory complexity, limi…
XFacta: Contemporary, Real-World Dataset and Evaluation for Multimodal Misinformation Detection with Multimodal LLMs
Yuzhuo Xiao, Zeyu Han, Yuhan Wang +1
The rapid spread of multimodal misinformation on social media calls for more effective and robust detection methods. Recent advances leveraging multimodal large language models (ML…