2 papers
cs.CV2026
Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework
Dongxu Ge, Shansong Liu, Cheng Gong +3
As an important subfield of cross-modal generation, synthesizing static visual content in the form of images from audio, namely audio-to-image (A2I) generation, has attracted incre…
cs.MM2025
UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation
Lei Zhao, Linfeng Feng, Dongxu Ge +5
With the rise of diffusion models, audio-video generation has been revolutionized. However, most existing methods rely on separate modules for each modality, with limited explorati…