collaborators
Showing cs.CVShow all

6 papers · 1 filter

cs.CV2026

NoisEasier: Test-Time Noise Optimization for Text-to-Video Generation

Yujiang Pu, Yu Kong

Diffusion models have recently advanced text-to-video (T2V) generation, yet they still struggle with fine-grained compositional alignment, such as attribute binding, spatial relati…

cs.CV2026

Spatially Prompted Visual Trajectory Prediction for Egocentric Manipulation

Yifan Li, Xinyu Zhou, Yunhao Ge +2

Language instructions offer a flexible way to specify task semantics but can become ambiguous in cluttered scenes containing multiple visually similar objects and candidate targets…

cs.CV2025

ProcObject-10K: Benchmarking Object-Centric Procedural Understanding in Instructional Videos

Wenliang Guo, Yu Kong

Procedural activities are fundamentally driven by object state transitions, yet existing instructional video benchmarks remain action-centric and cannot evaluate whether models rea…

cs.CV2025

Procedural Mistake Detection via Action Effect Modeling

Wenliang Guo, Yujiang Pu, Yu Kong

Mistake detection in procedural tasks is essential for building intelligent systems that support learning and task execution. Existing approaches primarily analyze how an action is…

cs.CV2024

SHINE: Saliency-aware HIerarchical NEgative Ranking for Compositional Temporal Grounding

Zixu Cheng, Yujiang Pu, Shaogang Gong +2

Temporal grounding, also known as video moment retrieval, aims at locating video segments corresponding to a given query sentence. The compositional nature of natural language enab…

cs.CV2023

ATM: Action Temporality Modeling for Video Question Answering

Junwen Chen, Jie Zhu, Yu Kong

Despite significant progress in video question answering (VideoQA), existing methods fall short of questions that require causal/temporal reasoning across frames. This can be attri…