1 paper
Chujun Tang, Lei Zhong, Fangqiang Ding
Do video diffusion models encode signals predictive of physical plausibility? We probe intermediate denoising representations of pretrained Diffusion Transformers (DiTs) and find t…