1 paper
Naoya Sogi, Takashi Shibata, Makoto Terao
The pre-trained vision and language (V\&L) models have substantially improved the performance of cross-modal image-text retrieval. In general, however, V\&L models have limited ret…