2 papers
cs.CL2025
KréyoLID From Language Identification Towards Language Mining
Rasul Dent, Pedro Ortiz Suarez, Thibault Clérice +1
Automatic language identification is frequently framed as a multi-class classification problem. However, when creating digital corpora for less commonly written languages, it may b…
cs.CV2024
Diachronic Document Dataset for Semantic Layout Analysis
Thibault Clérice, Juliette Janes, Hugo Scheithauer +5
We present a novel, open-access dataset designed for semantic layout analysis, built to support document recreation workflows through mapping with the Text Encoding Initiative (TEI…