1 paper
Shaoqing Lin, Chong Teng, Fei Li +3
Vision-Language Models (VLMs) generate discourse-level, multi-sentence visual descriptions, challenging text scene graph parsers built for single-sentence caption-to-graph mapping.…