2 papers
cs.CV2025
MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites
Zhenxin Lei, Zhangwei Gao, Changyao Tian +12
Generalist visual captioning goes beyond a simple appearance description task, but requires integrating a series of visual cues into a caption and handling various visual domains.…
cs.CV2025
IPDN: Image-enhanced Prompt Decoding Network for 3D Referring Expression Segmentation
Qi Chen, Changli Wu, Jiayi Ji +3
3D Referring Expression Segmentation (3D-RES) aims to segment point cloud scenes based on a given expression. However, existing 3D-RES approaches face two major challenges: feature…