5 papers · 1 filter
DIFFCZSL: Compositional Zero-Shot Learning Regularized by Diffusion Representations
Hangyu Tian, Zhenqi He, Yanghao Wang +1
Compositional Zero-Shot Learning (CZSL) aims to recognize unseen attribute-object compositions by leveraging knowledge of primitive concepts learned from seen compositions. Althoug…
FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval
Zhenqi He, Ziqi Jiang, Yuanpei Liu +3
Zero-shot composed image retrieval (ZS-CIR) aims to retrieve a target image by editing a reference image with a natural-language instruction, without relying on domain-specific ann…
LISA: Likelihood Score Alignment for Visual-condition Controllable Generation
Yanghao Wang, Hongxu Chen, Jiazhen Liu +4
The prevalent dual-branch paradigm, i.e., training a side network to encode visual conditions and fusing its intermediate-layer features to a frozen pretrained main network, has sh…
FlowComposer: Composable Flows for Compositional Zero-Shot Learning
Zhenqi He, Lin Li, Long Chen
Compositional zero-shot learning (CZSL) aims to recognize unseen attribute-object compositions by recombining primitives learned from seen pairs. Recent CZSL methods built on visio…
Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?
Yang Yao, Lingyu Li, Jiaxin Song +8
As Multimodal Large Language Models (MLLMs) continue to evolve, their cognitive and reasoning capabilities have seen remarkable progress. However, challenges in visual fine-grained…