3 papers
cs.CV2026
Improved Iterative Refinement for Chart-to-Code Generation via Structured Instruction
Chengzhi Xu, Yuyang Wang, Lai Wei +2
Recently, multimodal large language models (MLLMs) have attracted increasing research attention due to their powerful visual understanding capabilities. While they have achieved im…
cs.CV2026
Edge-Optimized Multimodal Learning for UAV Video Understanding via BLIP-2
Yizhan Feng, Hichem Snoussi, Jing Teng +4
The demand for real-time visual understanding and interaction in complex scenarios is increasingly critical for unmanned aerial vehicles. However, a significant challenge arises fr…
cs.CV2025
Text-to-3D Generation by 2D Editing
Haoran Li, Yuli Tian, Yonghui Wang +4
Distilling 3D representations from pretrained 2D diffusion models is essential for 3D creative applications across gaming, film, and interior design. Current SDS-based methods are…