3 papers
cs.CV2026
Scene Prior Filtering for Depth Super-Resolution
Zhengxue Wang, Zhiqiang Yan, Ming-Hsuan Yang +4
Multi-modal fusion serves as a cornerstone for successful depth map super-resolution. However, commonly used fusion strategies, such as addition and concatenation, fall short of ef…
cs.CL2025
Discrete Tokenization for Multimodal LLMs: A Comprehensive Survey
Jindong Li, Yali Fu, Jiahong Liu +5
The rapid advancement of large language models (LLMs) has intensified the need for effective mechanisms to transform continuous multimodal data into discrete representations suitab…
cs.CV2025
Nested Annealed Training Scheme for Generative Adversarial Networks
Chang Wan, Ming-Hsuan Yang, Minglu Li +2
Recently, researchers have proposed many deep generative models, including generative adversarial networks(GANs) and denoising diffusion models. Although significant breakthroughs…