1 paper
Yuan-Hong Liao, Rafid Mahmood, Sanja Fidler +1
Enhancing semantic grounding abilities in Vision-Language Models (VLMs) often involves collecting domain-specific training data, refining the network architectures, or modifying th…