1 paper
Jiajin Guan, Haibo Mei, Bonan Zhang +3
Recent advances in vision-language models (VLMs) have demonstrated strong generalization in natural image tasks. However, their performance often degrades on unmanned aerial vehicl…