1 paper · 1 filter
Abhishek Dalvi, Vasant Honavar
Large unimodal foundation models for vision and language encode rich semantic structures, yet aligning them typically requires computationally intensive multimodal fine-tuning. Suc…