2 papers
cs.CL2024
TextGram: Towards a better domain-adaptive pretraining
Sharayu Hiwarkhedkar, Saloni Mittal, Vidula Magdum +4
For green AI, it is crucial to measure and reduce the carbon footprint emitted during the training of large language models. In NLP, performing pre-training on Transformer models r…
cs.CL2024
L3Cube-IndicNews: News-based Short Text and Long Document Classification Datasets in Indic Languages
Aishwarya Mirashi, Srushti Sonavane, Purva Lingayat +2
In this work, we introduce L3Cube-IndicNews, a multilingual text classification corpus aimed at curating a high-quality dataset for Indian regional languages, with a specific focus…