4 papers · 1 filter
Video-Mirai: Autoregressive Video Diffusion Models Need Foresight
Yonghao Yu, Lang Huang, Runyi Li +2
Causal video generators must predict from the past, but they need not learn only from it. In streaming autoregressive video diffusion, each emitted segment becomes a commitment tha…
Mirai: Autoregressive Visual Generation Needs Foresight
Yonghao Yu, Lang Huang, Zerun Wang +2
Autoregressive (AR) visual generators model images as sequences of discrete tokens and are trained with a next-token likelihood objective. This strict causal supervision optimizes…
Joint Fusion and Encoding: Advancing Multimodal Retrieval from the Ground Up
Lang Huang, Qiyu Wu, Zhongtao Miao +1
Information retrieval is indispensable for today's Internet applications, yet traditional semantic matching techniques often fall short in capturing the fine-grained cross-modal in…
SCOMatch: Alleviating Overtrusting in Open-set Semi-supervised Learning
Zerun Wang, Liuyu Xiang, Lang Huang +3
Open-set semi-supervised learning (OSSL) leverages practical open-set unlabeled data, comprising both in-distribution (ID) samples from seen classes and out-of-distribution (OOD) s…