3 papers
cs.CV2025
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
Jie Cai, Kangning Yang, Lan Fu +6
We introduce CompareBench, a benchmark for evaluating visual comparison reasoning in vision-language models (VLMs), a fundamental yet understudied skill. CompareBench consists of 1…
cs.CV2025
TokenMotion: Decoupled Motion Control via Token Disentanglement for Human-centric Video Generation
Ruineng Li, Daitao Xing, Huiming Sun +3
Human-centric motion control in video generation remains a critical challenge, particularly when jointly controlling camera movements and human poses in scenarios like the iconic G…
cs.CV2025
VIP: Video Inpainting Pipeline for Real World Human Removal
Huiming Sun, Yikang Li, Kangning Yang +11
Inpainting for real-world human and pedestrian removal in high-resolution video clips presents significant challenges, particularly in achieving high-quality outcomes, ensuring tem…