4 papers
MIXAR: Scaling Autoregressive Pixel-based Language Models to Multiple Languages and Scripts
Chen Hu, Yintao Tai, Antonio Vergari +2
Pixel-based language models are gaining momentum as alternatives to traditional token-based approaches, promising to circumvent tokenization challenges. However, the inherent perce…
Think Before you Write: QA-Guided Reasoning for Character Descriptions in Books
Argyrios Papoudakis, Mirella Lapata, Frank Keller
Character description generation is an important capability for narrative-focused applications such as summarization, story analysis, and character-driven simulations. However, gen…
End-to-End Long Document Summarization using Gradient Caching
Rohit Saxena, Hao Tang, Frank Keller
Training transformer-based encoder-decoder models for long document summarization poses a significant challenge due to the quadratic memory consumption during training. Several app…
PosterSum: A Multimodal Benchmark for Scientific Poster Summarization
Rohit Saxena, Pasquale Minervini, Frank Keller
Generating accurate and concise textual summaries from multimodal documents is challenging, especially when dealing with visually complex content like scientific posters. We introd…