2 papers
cs.CL2025
Krutrim LLM: A Novel Tokenization Strategy for Multilingual Indic Languages with Petabyte-Scale Data Processing
Rahul Kumar, Shubham Kakde, Divyansh Rajput +6
We present a novel approach to data preparation for developing multilingual Indic large language model. Our meticulous data acquisition spans open-source and proprietary sources, i…
cs.CL2025
Krutrim LLM: Multilingual Foundational Model for over a Billion People
Aditya Kallappa, Palash Kamble, Abhinav Ravi +10
India is a diverse society with unique challenges in developing AI systems, including linguistic diversity, oral traditions, data accessibility, and scalability. Existing foundatio…