1 paper
Yi Zhang, Chun-Wun Cheng, Junyi He +5
Recent research in Vision-Language Models (VLMs) has significantly advanced our capabilities in cross-modal reasoning. However, existing methods suffer from performance degradation…