collaborators

8 papers

cs.CV2026

Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation

Shuyuan Tu, Qi Tian, Zihan Yang +9

Current open-source diffusion models struggle to generate stable and synchronized audio-visual content, particularly in scenarios demanding complex semantic reasoning. The root cau…

cs.CV2026

Occlusion-Aware Physics-Semantic Keyframe Selection for Robust Video Editing

Lin Liu, Zhihan Xiao, Haohang Xu +4

Video editing has recently achieved remarkable progress with diffusion-based generative models, enabling diverse object-level manipulations from natural language instructions. Howe…

cs.CV2026

Towards Reliable Fetal Ultrasound Interpretation with Multi-Agent Collaboration

Xiaotian Hu, Mingxuan Liu, Junwei Huang +13

Automated fetal ultrasound interpretation requires a workflow from visual perception, including plane recognition and anatomical segmentation, to clinical understanding, including…

cs.CV2026

Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing

Yan Li, Lin Liu, Xiaopeng Zhang +1

Instruction-based video editing requires transforming a source video according to a natural-language instruction while preserving irrelevant content and remaining temporally cohere…

cs.LG2026

Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models

Jade Zou, Tao Huang, Weijie Kong +7

Reinforcement learning (RL) has become an effective way to improve prompt alignment and perceptual quality in diffusion and flow-matching generators. A critical step for applying o…

cs.CV2026

OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning

Kaihang Pan, Qi Tian, Jianwei Zhang +11

While proprietary systems such as Seedance-2.0 have achieved remarkable success in omni-capable video generation, open-source alternatives significantly lag behind. Most academic m…