1 paper
Zhijiang Tang, Linhua Wang, Jiaxin Qi +4
Image captioning remains a fundamental task for vision language understanding, yet ground-truth supervision still relies predominantly on human-annotated references. Because human…