1 paper
Zhichao Yin, Binyuan Hui, Min Yang +2
Recently, substantial advancements in pre-trained vision-language models have greatly enhanced the capabilities of multi-modal dialog systems. These models have demonstrated signif…