3 papers
cs.CY2026
Language-Specific Gaps in AI Safety Training Datasets
Chialuka Prisca-Mary Onuoha, Bright Etornam Sunu, Rashidat Sikiru
Large language model providers routinely cite multilingual safety benchmarks spanning a dozen or more languages as evidence that their models are safe for non-English-speaking user…
cs.DB2026
Eiger: An Efficient Library for GPU-based Data Analytics
Bowen Wu, Marko KabiÄ, Sven Hepkema +3
GPUs have become an increasingly attractive platform for accelerating analytical workloads due to their massive parallelism and high memory bandwidth. Recent studies show that in s…
cs.LG2026
A Super Fast K-means for Indexing Vector Embeddings
Leonardo Kuffo, Sven Hepkema, Peter Boncz
We present SuperKMeans: a k-means variant designed for clustering collections of high-dimensional vector embeddings. SuperKMeans' clustering is up to 7x faster than FAISS and Sciki…