4 papers
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
Jie Cai, Kangning Yang, Lan Fu +6
We introduce CompareBench, a benchmark for evaluating visual comparison reasoning in vision-language models (VLMs), a fundamental yet understudied skill. CompareBench consists of 1…
OpenRR-5k: A Large-Scale Benchmark for Reflection Removal in the Wild
Jie Cai, Kangning Yang, Ling Ouyang +4
Removing reflections is a crucial task in computer vision, with significant applications in photography and image enhancement. Nevertheless, existing methods are constrained by the…
Degradation-Aware Image Enhancement via Vision-Language Classification
Jie Cai, Kangning Yang, Jiaming Ding +5
Image degradation is a prevalent issue in various real-world applications, affecting visual quality and downstream processing tasks. In this study, we propose a novel framework tha…
TokenMotion: Decoupled Motion Control via Token Disentanglement for Human-centric Video Generation
Ruineng Li, Daitao Xing, Huiming Sun +3
Human-centric motion control in video generation remains a critical challenge, particularly when jointly controlling camera movements and human poses in scenarios like the iconic G…