cs.CV
156.8k resultsMotion Beyond Morphology: Bootstrapping Cross-Category Motion Transfer from Abstract Motion Representations
Zhixue Fang, Zhimin Zhang, Bi'an Du +6
StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring
Xiangyue Zhang, Jianfang Li, Jiaxu Zhang +2
FairForensics: Seeing Expressions and Parsing Demographics via Vision-Language Modeling for Generalizable Fair Deepfake Detection
Yaning Zhang, Jiao Wu, Zan Gao +1
FAU at ImageCLEF 2026 Task on Multimodal Reasoning Robust Candidate Scoring and Concise Multilingual Visual Answering
Mohamed Basem, Vincent Christlein
Generative Brownian Bridge Diffusion In Motion Space For Enhanced Myocardial Strain Analysis
Rishov Paul, Frederick H. Epstein, Miaomiao Zhang
Generative AI and Foundation Models in Medical Image
Masahiro Oda
Entity-Aware Sequence Transduction for Player-Centric Ball Action Spotting
Ruifeng Wang, Di Yang, Jiangtao Wang
SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models
Hai Nguyen, Tung Vu, Cong Tran
When Extreme Darkness Meets Motion Blur: MeanFlow for Unified RAW Restoration
Zepu Wang, Jingze Liang, Weijie Xiao +1
IDraw: Artist Verification from Digital Drawing Images
Nayoung Kim, Nan Jiang, Bangjie Sun +3
SPECTRA: Band-Routed Embedding and Stage-Wise LoRA for Cross-Sensor Fine-Tuning of Geospatial Foundation Models
Xingyan Li, Jordan A. Caraballo-Vega, Jie Gong +2
Can Urban Blight Be Accessed with Vision-language Models: A Case Study in Detroit
Xiaohao Yang, Aohua Tian, Derek Van Berkel +2
Pixel Ignores, Superpixel Sees: Adverse Weather Image Restoration via Semantic-Center SSM
Dayu Li, Shihao Zhou, Leizhi Shu +3
DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models
Yongkang Zhou, Xiang Xia, Cheng Yan +2
Decoupling semantics from vision: A framework for faithful visual-text compression evaluation
Yonghan Gao, Zehong Chen, Lijian Xu +3
Transformer Geometry Observatory TGO-III: Semantic Geometry Observatory
Kaustubh Kapil, Kishor P. Upla
Beyond Illumination: A Conditional Mutual Information-Guided Network for Low-Light Image Enhancement
Ya-nan Guan, Shaonan Zhang, Tao Dai +5
GeoCore-9B: Towards Geo-Aware Generative Foundation Models in Earth Observation
Jeonghyeok Do, Munchurl Kim
PhotoHOI: Synthesizing 3D Hand-Object Interactions from a Single RGB Photograph
Zhenhao Zhang, Jiajun Zhang, Wei Min +1
Assessing the Benefits of Combining Advanced Deep Learning Techniques for Post-Disaster Building Damage Assessment from UAV Imagery
Huy Quang Ung, Guillaume Habault, Roberto Legaspi +3
CHOW-SLAM: Compact Hybrid Representation with Complementary Overlap Window Optimization for RGB-D SLAM
Wenxuan Ji, Jin Xiao, Xiaoguang Hu +3
CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation
Xianjing Han, Yuhan Su, Yang Deng +3
UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation
Liming Tan, Ye Chen, Hao Zhang +3
Event ActivityNet: A Large-Scale Simulated-Event Benchmark for Untrimmed Action Understanding
Cheng-Yao Hong, Ting-Wei Lin, Yun-Chung Lai +3