3 papers
cs.CV2025
Sortblock: Similarity-Aware Feature Reuse for Diffusion Model
Hanqi Chen, Xu Zhang, Xiaoliu Guan +4
Diffusion Transformers (DiTs) have demonstrated remarkable generative capabilities, particularly benefiting from Transformer architectures that enhance visual and artistic fidelity…
cs.CV2025
Enabling Versatile Controls for Video Diffusion Models
Xu Zhang, Hao Zhou, Haoming Qin +5
Despite substantial progress in text-to-video generation, achieving precise and flexible control over fine-grained spatiotemporal attributes remains a significant unresolved challe…
cs.CV2025
PP-DocBee: Improving Multimodal Document Understanding Through a Bag of Tricks
Feng Ni, Kui Huang, Yao Lu +4
With the rapid advancement of digitalization, various document images are being applied more extensively in production and daily life, and there is an increasingly urgent need for…