papers
Publications (11)
cs.CV2025
Wan: Open and Advanced Large-Scale Video Generative Models
Team Wan, Ang Wang, Baole Ai +58
cs.CV2024
Group Diffusion Transformers are Unsupervised Multitask Learners
Lianghua Huang, Wei Wang, Zhi-Fan Wu +6
cs.CV2024
ChatDiT: A Training-Free Baseline for Task-Agnostic Free-Form Chatting with Diffusion Transformers
Lianghua Huang, Wei Wang, Zhi-Fan Wu +7
cs.LG2022
Grow and Merge: A Unified Framework for Continuous Categories Discovery
Xinwei Zhang, Jianwen Jiang, Yutong Feng +6
cs.CV2026
Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models
Lianghua Huang, Zhi-Fan Wu, Wei Wang +22
cs.LG2021
NGC: A Unified Framework for Learning with Open-World Noisy Data
Zhi-Fan Wu, Tong Wei, Jianwen Jiang +3
cs.CV2024
IDEA-Bench: How Far are Generative Models from Professional Designing?
Chen Liang, Lianghua Huang, Jingwu Fang +7
cs.CV2024
In-Context LoRA for Diffusion Transformers
Lianghua Huang, Wei Wang, Zhi-Fan Wu +6
cs.CV2026
Video = World + Event Stream
Lianghua Huang, Zhi-Fan Wu, Yupeng Shi +24
The paper introduces Wan-Streamer v0.3, a model that treats video as a combination of a persistent world and a dynamic event stream, enabling real-time multimodal audio‑visual inte…
#video streaming#multimodal interaction#real-time AI#audio-visual modeling
cs.CV2026
FlashFace: Human Image Personalization with High-fidelity Identity Preservation
Shilong Zhang, Lianghua Huang, Xi Chen +7
cs.CV2026
Wan-Streamer v0.2: Higher Resolution, Same Latency
Lianghua Huang, Zhi-Fan Wu, Yupeng Shi +23