3 papers
cs.CV2026
BabyVision: Visual Reasoning Beyond Language
Liang Chen, Weichu Xie, Yiyan Liang +27
While humans develop core visual skills long before acquiring language, contemporary Multimodal LLMs (MLLMs) still rely heavily on linguistic priors to compensate for their fragile…
cs.LG2026
Moment Matching Q-Learning
Yiyan, Liang, Sifei Liu +1
Score-based and flow-based generative models exhibit remarkable expressive capacity in capturing complex distributions, and have been extensively deployed in tasks ranging from ima…
cs.RO2025
Dynamic Rank Adjustment in Diffusion Policies for Efficient and Flexible Training
Xiatao Sun, Shuo Yang, Yinxing Chen +3
Diffusion policies trained via offline behavioral cloning have recently gained traction in robotic motion generation. While effective, these policies typically require a large numb…