1 paper · 1 filter
Patrick Amadeus Irawan, Erland Hilman Fuadi, Shanu Kumar +2
Adapting pretrained language models (LMs) into vision-language models (VLMs) can degrade their native linguistic capability due to representation shift and cross-modal interference…