1 paper
Raja Kumar, Arka Sadhu, Ram Nevatia
Large Vision Language Models (LVLMs) possess extensive text knowledge but struggles to utilize this knowledge for fine-grained image recognition, often failing to differentiate bet…