10 papers
AnyMod-LLVE: Low-Light Video Enhancement with Modality-Agnostic Inference
Hangfeng Liang, Yutao Hu, Yanhan Hu +3
Low-light video enhancement (LLVE) remains a challenging task due to severe information degradation under low-illumination conditions. Recent multimodal approaches have significant…
Impostor: An Agent-Curated Benchmark for Realistic AIGC Manipulation Localization
Zhenliang Li, Yutao Hu, Qixiong Wang +5
Recent advances in generative image editing have improved the realism and controllability of localized image manipulation, raising new challenges for image manipulation detection a…
Car-1000: A New Large Scale Fine-Grained Visual Categorization Dataset
Yutao Hu, Sen Li, Jincheng Yan +2
Fine-grained visual categorization (FGVC) is a challenging but significant task in computer vision, which aims to recognize different sub-categories of birds, cars, airplanes, etc.…
StructDiff: Structure-aware Diffusion Model for 3D Fine-grained Medical Image Synthesis
Jiahao Xia, Yutao Hu, Yaolei Qi +6
Solving medical imaging data scarcity through semantic image generation has attracted growing attention in recent years. However, existing generative models mainly focus on synthes…
EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation
Siyuan Huang, Liliang Chen, Pengfei Zhou +8
We introduce EnerVerse, a generative robotics foundation model that constructs and interprets embodied spaces. EnerVerse employs a chunk-wise autoregressive video diffusion framewo…
Cardiac-CLIP: A Vision-Language Foundation Model for 3D Cardiac CT Images
Yutao Hu, Ying Zheng, Shumei Miao +20
Foundation models have demonstrated remarkable potential in medical domain. However, their application to complex cardiovascular diagnostics remains underexplored. In this paper, w…