1 paper · 1 filter
Arvind Krishna Sridhar, Yinyi Guo, Erik Visser +1
There has been significant research on developing pretrained transformer architectures for multimodal-to-text generation tasks. Albeit performance improvements, such models are fre…