3 papers
cs.IR2026
Douyin Multimodal Embedding Model Technical Report
Haonan Chen, Chu Li, Zhicheng Wang +4
Multimodal representation learning is a cornerstone of modern AI. By encoding multimodal queries and targets into vectors, it powers industrial search and recommendation and underp…
cs.CV2026
DynTrace: Tracking Dynamic Object Evidence for 4D Spatio-Temporal Reasoning in MLLMs
Rongxin Gao, Yuzhi Huang, Dongxuan Liu +8
4D spatio-temporal reasoning, jointly modeling 3D spatial structure and temporal evolution, is essential for understanding dynamic worlds and enabling embodied interaction. While c…
cs.IR2026
U-MARVEL: Unveiling Key Factors for Universal Multimodal Retrieval via Embedding Learning with MLLMs
Xiaojie Li, Chu Li, Shi-Zhe Chen +1
Universal multimodal retrieval (UMR), which aims to address complex retrieval tasks where both queries and candidates span diverse modalities, has been significantly advanced by th…