2 papers
cs.AI2026
Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated Attention
Abid Ali, Diego Molla-Aliod, Usman Naseem
Multimodal summarization requires models to jointly understand textual and visual inputs to generate concise, semantically coherent summaries. Existing methods often inject shallow…
cs.AI2026
Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity
Abid Ali, Diego Molla-Aliod, Usman Naseem
Multimodal Large Language Models (MLLMs) have facilitated Multimodal Summarization with Multimodal Output (MSMO), wherein systems generate concise textual summaries accompanied by…