3 papers
cs.CL2025
L3Cube-IndicHeadline-ID: A Dataset for Headline Identification and Semantic Evaluation in Low-Resource Indian Languages
Nishant Tanksale, Tanmay Kokate, Darshan Gohad +2
Semantic evaluation in low-resource languages remains a major challenge in NLP. While sentence transformers have shown strong performance in high-resource settings, their effective…
cs.CL2025
IndicSQuAD: A Comprehensive Multilingual Question Answering Dataset for Indic Languages
Sharvi Endait, Ruturaj Ghatage, Aditya Kulkarni +2
The rapid progress in question-answering (QA) systems has predominantly benefited high-resource languages, leaving Indic languages largely underrepresented despite their vast nativ…
cs.CL2025
Better To Ask in English? Evaluating Factual Accuracy of Multilingual LLMs in English and Low-Resource Languages
Pritika Rohera, Chaitrali Ginimav, Gayatri Sawant +1
Multilingual Large Language Models (LLMs) have demonstrated significant effectiveness across various languages, particularly in high-resource languages such as English. However, th…