3 papers
cs.CV2026
IIR-VLM: In-Context Instance-level Recognition for Large Vision-Language Models
Liang Shi, Wei Li, Kevin M Beussman +2
Instance-level recognition (ILR) concerns distinguishing individual instances from one another, with person re-identification as a prominent example. Despite the impressive visual…
cs.CL2025
CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning
Qihua Dong, Luis Figueroa, Handong Zhao +5
Referring Expression Comprehension and Segmentation are critical tasks for assessing the integration of language understanding and image comprehension, serving as benchmarks for Mu…
cs.CV2025
ExpertGen: Training-Free Expert Guidance for Controllable Text-to-Face Generation
Liang Shi, Yun Fu
Recent advances in diffusion models have significantly improved text-to-face generation, but achieving fine-grained control over facial features remains a challenge. Existing metho…