2 papers
cs.CV2026
NoisEasier: Test-Time Noise Optimization for Text-to-Video Generation
Yujiang Pu, Yu Kong
Diffusion models have recently advanced text-to-video (T2V) generation, yet they still struggle with fine-grained compositional alignment, such as attribute binding, spatial relati…
cs.CV2025
Procedural Mistake Detection via Action Effect Modeling
Wenliang Guo, Yujiang Pu, Yu Kong
Mistake detection in procedural tasks is essential for building intelligent systems that support learning and task execution. Existing approaches primarily analyze how an action is…