1 paper · 1 filter
Mina Huh, Fangyuan Xu, Yi-Hao Peng +5
Vision language models can now generate long-form answers to questions about images - long-form visual question answers (LFVQA). We contribute VizWiz-LF, a dataset of long-form ans…