1 paper · 1 filter
Chen Jin, Ryutaro Tanno, Amrutha Saseendran +2
We introduce Lavender, a simple supervised fine-tuning (SFT) method that boosts the performance of advanced vision-language models (VLMs) by leveraging state-of-the-art image gener…