3 papers
cs.CL2025
L3Cube-MahaSTS: A Marathi Sentence Similarity Dataset and Models
Aishwarya Mirashi, Ananya Joshi, Raviraj Joshi
We present MahaSTS, a human-annotated Sentence Textual Similarity (STS) dataset for Marathi, along with MahaSBERT-STS-v2, a fine-tuned Sentence-BERT model optimized for regression-…
cs.CL2025
MahaParaphrase: A Marathi Paraphrase Detection Corpus and BERT-based Models
Suramya Jadhav, Abhay Shanbhag, Amogh Thakurdesai +3
Paraphrases are a vital tool to assist language understanding tasks such as question answering, style transfer, semantic parsing, and data augmentation tasks. Indic languages are c…
cs.CL2024
Universal Cross-Lingual Text Classification
Riya Savant, Anushka Shelke, Sakshi Todmal +3
Text classification, an integral task in natural language processing, involves the automatic categorization of text into predefined classes. Creating supervised labeled datasets fo…