4 papers
RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation
Lexi Pang, Liheng Zhang, Hang Ye +2
Text-to-image (T2I) diffusion models have shown remarkable success in generating high-quality images from text prompts. Recent efforts extend these models to incorporate conditiona…
Referring Camouflaged Object Detection With Multi-Context Overlapped Windows Cross-Attention
Yu Wen, Shuyong Gao, Shuping Zhang +6
Referring camouflaged object detection (Ref-COD) aims to identify hidden objects by incorporating reference information such as images and text descriptions. Previous research has…
HCC-3D: Hierarchical Compensatory Compression for 98% 3D Token Reduction in Vision-Language Models
Liheng Zhang, Jin Wang, Hui Li +2
3D understanding has drawn significant attention recently, leveraging Vision-Language Models (VLMs) to enable multi-modal reasoning between point cloud and text data. Current 3D-VL…
SA-3DGS: A Self-Adaptive Compression Method for 3D Gaussian Splatting
Liheng Zhang, Weihao Yu, Zubo Lu +2
Recent advancements in 3D Gaussian Splatting have enhanced efficient and high-quality novel view synthesis. However, representing scenes requires a large number of Gaussian points,…