activity
20242026
collaborators
Showing cs.CVShow all

10 papers · 1 filter

cs.CV2026

ReMoMask-2: Latent Retrieval-Augmented Masked Motion Generation

Yiran Wang, Zeyu Zhang, Ling Shao +1

Text-to-motion (T2M) generation maps natural language to human joint movements, aiding gaming, VR, and robotics. Retrieval-Augmented Text-to-Motion (RAG-T2M) improves generation on…

cs.CV2026

VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

Jiazi Wang, Nonghai Zhang, Qiushi Xie +5

Vision-language models (VLMs) have made interactive digital museums increasingly feasible by connecting 3D digitization with natural-language artifact exploration. However, in cult…

cs.CV2026

SCOPE: Simulating Cross-game Operations in Playable Environments for FPS World Models

Zizhao Tong, Yeying Jin, Hongfeng Lai +11

Interactive world models for first-person shooter (FPS) games must resolve high-frequency overlapping control signals at every frame without disrupting unaffected regions. Existing…

cs.CV2025

Spatial-Temporal Graph Mamba for Music-Guided Dance Video Synthesis

Hao Tang, Ling Shao, Zhenyu Zhang +2

We propose a novel spatial-temporal graph Mamba (STG-Mamba) for the music-guided dance video synthesis task, i.e., to translate the input music to a dance video. STG-Mamba consists…

cs.CV2025

Replace in Translation: Boost Concept Alignment in Counterfactual Text-to-Image

Sifan Li, Ming Tao, Hao Zhao +2

Text-to-Image (T2I) has been prevalent in recent years, with most common condition tasks having been optimized nicely. Besides, counterfactual Text-to-Image is obstructing us from…

cs.CV2025

SAMba-UNet: SAM2-Mamba UNet for Cardiac MRI in Medical Robotic Perception

Guohao Huo, Ruiting Dai, Ling Shao +1

To address complex pathological feature extraction in automated cardiac MRI segmentation, we propose SAMba-UNet, a novel dual-encoder architecture that synergistically combines the…