6 papers
Beyond Objects: Contextual Synthetic Data Generation for Fine-Grained Classification
William Yang, Xindi Wu, Zhiwei Deng +2
Text-to-image (T2I) models are increasingly used for synthetic dataset generation, but generating effective synthetic training data for classification remains challenging. Fine-tun…
ICONS: Influence Consensus for Vision-Language Data Selection
Xindi Wu, Mengzhou Xia, Rulin Shao +3
Training vision-language models via instruction tuning relies on large data mixtures spanning diverse tasks and domains, yet these mixtures frequently include redundant information…
A Sampling-Based Domain Generalization Study with Diffusion Generative Models
Ye Zhu, Yu Wu, Duo Xu +3
In this work, we investigate the domain generalization capabilities of diffusion models in the context of synthesizing images that are distinct from the training data. Instead of f…
Dynamic Diffusion Schrödinger Bridge in Astrophysical Observational Inversions
Ye Zhu, Duo Xu, Zhiwei Deng +2
We study Diffusion Schrödinger Bridge (DSB) models in the context of dynamical astrophysical systems, specifically tackling observational inverse prediction tasks within Giant Mol…
DD-Ranking: Rethinking the Evaluation of Dataset Distillation
Zekai Li, Xinhao Zhong, Samir Khaki +49
In recent years, dataset distillation has provided a reliable solution for data compression, where models trained on the resulting smaller synthetic datasets achieve performance co…
A Label is Worth a Thousand Images in Dataset Distillation
Tian Qin, Zhiwei Deng, David Alvarez-Melis
Data is a crucial factor in the performance of machine learning models, a principle that dataset distillation methods exploit by compressing training datasets in…