1 paper
Chen-Hao Chao, Wei-Fang Sun, Junwei Quan +2
Masked diffusion models (MDM) exhibit superior generalization when learned using a Partial masking scheme (Prime). This approach converts tokens into sub-tokens and models the diff…