1 paper
Amit Kumar Jaiswal, Haiming Liu, Ingo Frommholz
Textual descriptions for multimodal inputs entail recurrent refinement of queries to produce relevant output images. Despite efforts to address challenges such as scaling model siz…