2 papers
cs.CL2026
Data filtering methods for training language models
Egor Shevchenko, Elena Bruches
Data quality is a critical factor in the effectiveness of machine learning models. Label errors, present even in widely used benchmarks, introduce noise into training data and redu…
cs.CL2025
AINL-Eval 2025 Shared Task: Detection of AI-Generated Scientific Abstracts in Russian
Tatiana Batura, Elena Bruches, Milana Shvenk +1
The rapid advancement of large language models (LLMs) has revolutionized text generation, making it increasingly difficult to distinguish between human- and AI-generated content. T…