1 paper · 1 filter
Hillary Mutisya, John Mugane, Gavin Nyamboga +2
We present the Thiomi Dataset, a large-scale multimodal corpus spanning ten African languages across four language families: Swahili, Kikuyu, Kamba, Kimeru, Luo, Maasai, Kipsigis,…