129 citations
- Masoud Hashemi2 profiles2 · h 5
- Aaron Gokaslan1 · h 9
- Aitor Soroa Etxabe1 · h 33
- Albert Villanova del Moral1 · h 17
- Amaury Habrard1 · h 28
- Angelina McMillan-Major1 · h 11
- Anna Rogers1 · h 24
- Chenghao Mou1 · h 7
- Christopher Akiki1 · h 12
- Daniel Alexander van Strien1 · h 10
- David Ifeoluwa Adelani1 · h 33
- E. G. Ponferrada1
- Allen Institute for Artificial IntelligenceUS1 paper
- Booz Allen Hamilton (United States)US1 paper
- British LibraryGB1 paper
- CentraleSupélecFR1 paper
- Centre Inria de l'Université de RennesFR1 paper
- Cornell UniversityUS1 paper
- Delft University of TechnologyNL1 paper
- Ferrum CollegeUS1 paper
- Google DeepMind (United Kingdom)GB1 paper
- Google (United States)US1 paper
- HealthNow New YorkUS1 paper
- Hugging FaceUS1 paper
Showing cs.CLShow all
2 papers · 1 filter
cs.CL2024★ 1 cited
Prompting with Phonemes: Enhancing LLMs' Multilinguality for Non-Latin Script Languages
Hoang H Nguyen, Khyati Mahajan, Vikas Yadav +4
Although multilingual LLMs have achieved remarkable performance across benchmarks, we find they continue to underperform on non-Latin script languages across contemporary LLM famil…
cs.CL2023★ 65 cited
The BigScience ROOTS Corpus: A 1.6TB Composite Multilingual Dataset
Hugo Laurençon, Lucile Saulnier, Thomas Wang +51
As language models grow ever larger, the need for large-scale high-quality text datasets has never been more pressing, especially in multilingual settings. The BigScience workshop,…