1 paper · 1 filter
JeongYeon Nam, Jinbae Im, Wonjae Kim +1
Recent vision-language foundation models still frequently produce outputs misaligned with their inputs, evidenced by object hallucination in captioning and prompt misalignment in t…