6 papers
L3Cube-MahaPOS: A Marathi Part-of-Speech Tagging Dataset and BERT Models
Hariom Ingle, Ronit Ghode, Ishwari Gondkar +2
Part-of-Speech (POS) tagging is a foundational NLP task underpinning machine translation, information extraction, and syntactic parsing. Despite Marathi being spoken by over 83 mil…
IndicGuard: A Multilingual Safety Guard Model and Dataset for Indic Languages
Parth Bramhecha, Smit Deshmukh, Sairaj Bodhale +2
As Large Language Models (LLMs) achieve widespread integration across diverse linguistic landscapes, ensuring their safety and alignment with regional normative values remains a cr…
Better To Ask in English? Evaluating Factual Accuracy of Multilingual LLMs in English and Low-Resource Languages
Pritika Rohera, Chaitrali Ginimav, Gayatri Sawant +1
Multilingual Large Language Models (LLMs) have demonstrated significant effectiveness across various languages, particularly in high-resource languages such as English. However, th…
L3Cube-IndicHeadline-ID: A Dataset for Headline Identification and Semantic Evaluation in Low-Resource Indian Languages
Nishant Tanksale, Tanmay Kokate, Darshan Gohad +2
Semantic evaluation in low-resource languages remains a major challenge in NLP. While sentence transformers have shown strong performance in high-resource settings, their effective…
IndicSQuAD: A Comprehensive Multilingual Question Answering Dataset for Indic Languages
Sharvi Endait, Ruturaj Ghatage, Aditya Kulkarni +2
The rapid progress in question-answering (QA) systems has predominantly benefited high-resource languages, leaving Indic languages largely underrepresented despite their vast nativ…
L3Cube-IndicQuest: A Benchmark Question Answering Dataset for Evaluating Knowledge of LLMs in Indic Context
Pritika Rohera, Chaitrali Ginimav, Akanksha Salunke +2
Large Language Models (LLMs) have made significant progress in incorporating Indic languages within multilingual models. However, it is crucial to quantitatively assess whether the…