20 papers
DiverseDiT++: Quantifying, Analyzing, and Promoting Representation Diversity in Diffusion Transformers
Binglei Li, Mengping Yang, Zhiyu Tan +4
Recent advances in Diffusion Transformers (DiTs) have enabled remarkable progress in visual synthesis, benefiting from their superior scalability. To facilitate DiTs' capability of…
Monkey King Bang: A Unified Scientific Multimodal Foundation Model
Hesen Chen, Xinyu Su, Xiaomeng Yang +11
Scientific discovery is increasingly shifting from isolated disciplines to multi-domain reasoning, and AI for science faces a similar transition. Existing systems are either specia…
PhyMRI-SR: Toward Physics-Aware MRI Image Super-Resolution
Lihua Wei, Huatong Gao, Jia Gong +4
Magnetic resonance imaging (MRI) super-resolution is vital for improving diagnostic accessibility, yet most methods treat it as a deterministic mapping from a fixed low-resolution…
TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers
Binglei Li, Mengping Yang, Zhiyu Tan +2
Recent breakthroughs of transformer-based diffusion models, particularly with Multimodal Diffusion Transformers (MMDiT) driven models like FLUX and Qwen Image, have facilitated thr…
DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers
Mengping Yang, Zhiyu Tan, Binglei Li +3
Recent breakthroughs in Diffusion Transformers (DiTs) have revolutionized the field of visual synthesis due to their superior scalability. To facilitate DiTs' capability of capturi…
SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models
Xiaomeng Yang, Mengping Yang, Junyan Wang +3
Preference learning has garnered extensive attention as an effective technique for aligning diffusion models with human preferences in visual generation. However, existing alignmen…