1 citations · 1 across the 3 of their papers we have counts for
3 papers
cs.CL2025
Judging Quality Across Languages: A Multilingual Approach to Pretraining Data Filtering with Language Models
Mehdi Ali, Manuel Brack, Max Lübbering +15
High-quality multilingual training data is essential for effectively pretraining large language models (LLMs). Yet, the availability of suitable open-source multilingual datasets r…
cs.LG2024★ 1 cited
Navigating Shortcuts, Spurious Correlations, and Confounders: From Origins via Detection to Mitigation
David Steinmann, Felix Divo, Maurice Kraus +4
Shortcuts, also described as Clever Hans behavior, spurious correlations, or confounders, present a significant challenge in machine learning and AI, critically affecting model gen…
cs.LG2024
United We Pretrain, Divided We Fail! Representation Learning for Time Series by Pretraining on 75 Datasets at Once
Maurice Kraus, Felix Divo, David Steinmann +2
In natural language processing and vision, pretraining is utilized to learn effective representations. Unfortunately, the success of pretraining does not easily carry over to time…