Showing cs.CLShow all
2 papers · 1 filter
cs.CL2025
MixtureVitae: Open Web-Scale Pretraining Dataset With High Quality Instruction and Reasoning Data Built from Permissive-First Text Sources
Huu Nguyen, Victor May, Harsh Raj +14
We present MixtureVitae, an open-access pretraining corpus built to minimize legal risk while providing strong downstream performance. MixtureVitae follows a permissive-first, risk…
cs.CL2024
Vietnamese AI Generated Text Detection
Quang-Dan Tran, Van-Quan Nguyen, Quang-Huy Pham +2
In recent years, Large Language Models (LLMs) have become integrated into our daily lives, serving as invaluable assistants in completing tasks. Widely embraced by users, the abuse…