1 paper
Chenyu Zhou, Qiliang Jiang, Boguang Pan
Fine-tuning vision-language models to emit dense coordinate lists improves visual grounding but also changes how models serialize, repeat, and terminate structured outputs. We stud…