8 papers
Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation
Shuyuan Tu, Qi Tian, Zihan Yang +9
Current open-source diffusion models struggle to generate stable and synchronized audio-visual content, particularly in scenarios demanding complex semantic reasoning. The root cau…
Occlusion-Aware Physics-Semantic Keyframe Selection for Robust Video Editing
Lin Liu, Zhihan Xiao, Haohang Xu +4
Video editing has recently achieved remarkable progress with diffusion-based generative models, enabling diverse object-level manipulations from natural language instructions. Howe…
Towards Reliable Fetal Ultrasound Interpretation with Multi-Agent Collaboration
Xiaotian Hu, Mingxuan Liu, Junwei Huang +13
Automated fetal ultrasound interpretation requires a workflow from visual perception, including plane recognition and anatomical segmentation, to clinical understanding, including…
Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing
Yan Li, Lin Liu, Xiaopeng Zhang +1
Instruction-based video editing requires transforming a source video according to a natural-language instruction while preserving irrelevant content and remaining temporally cohere…
Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models
Jade Zou, Tao Huang, Weijie Kong +7
Reinforcement learning (RL) has become an effective way to improve prompt alignment and perceptual quality in diffusion and flow-matching generators. A critical step for applying o…
OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning
Kaihang Pan, Qi Tian, Jianwei Zhang +11
While proprietary systems such as Seedance-2.0 have achieved remarkable success in omni-capable video generation, open-source alternatives significantly lag behind. Most academic m…