NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (30)

cs.CL2019

Multilingual is not enough: BERT for Finnish

Antti Virtanen, Jenna Kanerva, Rami Ilo +5

cs.CL2025

Pretraining Finnish ModernBERTs

Akseli Reunamo, Laura-Maria Peltonen, Hans Moen +1

cs.CL2025

An Expanded Massive Multilingual Dataset for High-Performance Language Technologies (HPLT)

Laurie Burchell, Ona de Gibert, Nikolay Arefyev +32

cs.CL2006

Lexical Adaptation of Link Grammar to the Biomedical Sublanguage: a Comparative Evaluation of Three Approaches

Sampo Pyysalo, Tapio Salakoski, Sophie Aubin +1

cs.CL2025

FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models

Joona Kytöniemi, Jousia Piha, Akseli Reunamo +3

cs.CL2023

BLOOM: A 176B-Parameter Open-Access Multilingual Language Model

BigScience Workshop, :, Teven Le Scao +391

cs.CL2023

Silver Syntax Pre-training for Cross-Domain Relation Extraction

Elisa Bassignana, Filip Ginter, Sampo Pyysalo +2

cs.CY2026

If open source is to win, it must go public

Joshua Tan, Nicholas Vincent, Katherine Elkins +5

cs.CL2025

Scaling Data-Constrained Language Models

Niklas Muennighoff, Alexander M. Rush, Boaz Barak +6

cs.CL2020

Exploring Cross-sentence Contexts for Named Entity Recognition with BERT

Jouni Luoma, Sampo Pyysalo

cs.CL2024

A Survey of Large Language Models for European Languages

Wazir Ali, Sampo Pyysalo

cs.CL2023

FinGPT: Large Generative Models for a Small Language

Risto Luukkonen, Ville Komulainen, Jouni Luoma +18

cs.CL2026

Reasoning over Grammar: Can Synthetic Linguistic Reasoning Traces Enhance Low-Resource Machine Translation?

Renhao Pei, Yihong Liu, Sampo Pyysalo +2

cs.CL2026

HPLT 3.0: Very Large-Scale Multilingual Resources for LLMs and MT. Mono- and Bi-lingual Data, Multilingual Evaluation, and Pre-Trained Models

Stephan Oepen, Nikolay Arefev, Mikko Aulamo +29

cs.CL2021

Beyond the English Web: Zero-Shot Cross-Lingual and Lightweight Monolingual Classification of Registers

Liina Repo, Valtteri Skantsi, Samuel Rönnqvist +7

cs.CL2026

MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages

Maximilian Idahl, Jörg Tiedemann, Sampo Pyysalo +19

cs.CL2024

A New Massive Multilingual Dataset for High-Performance Language Technologies

Ona de Gibert, Graeme Nail, Nikolay Arefyev +10

cs.CL2021

Explaining Classes through Word Attribution

Samuel Rönnqvist, Amanda Myntti, Aki-Juhani Kyröläinen +3

cs.CL2021

Quantitative Evaluation of Alternative Translations in a Corpus of Highly Dissimilar Finnish Paraphrases

Li-Hsin Chang, Sampo Pyysalo, Jenna Kanerva +1

cs.CL2020

Towards Fully Bilingual Deep Language Modeling

Li-Hsin Chang, Sampo Pyysalo, Jenna Kanerva +1

cs.CL2025

Poro 34B and the Blessing of Multilinguality

Risto Luukkonen, Jonathan Burdge, Elaine Zosa +5

cs.CL2020

Universal Dependencies v2: An Evergrowing Multilingual Treebank Collection

Joakim Nivre, Marie-Catherine de Marneffe, Filip Ginter +6

cs.CL2020

WikiBERT models: deep transfer learning for many languages

Sampo Pyysalo, Jenna Kanerva, Antti Virtanen +1

cs.CL2016

Attending to Characters in Neural Sequence Labeling Models

Marek Rei, Gamal K. O. Crichton, Sampo Pyysalo

cs.CL2020

The birth of Romanian BERT

Stefan Daniel Dumitrescu, Andrei-Marius Avram, Sampo Pyysalo

cs.CL2024

Aurora-M: Open Source Continual Pre-training for Multilingual Language and Code

Taishi Nakamura, Mayank Mishra, Simone Tedeschi +42

cs.CL2025

Got Compute, but No Data: Lessons From Post-training a Finnish LLM

Elaine Zosa, Ville Komulainen, Sampo Pyysalo

cs.CL2021

Deep learning for sentence clustering in essay grading support

Li-Hsin Chang, Iiro Rastas, Sampo Pyysalo +1

cs.CL2025

Register Always Matters: Analysis of LLM Pretraining Data Through the Lens of Language Variation

Amanda Myntti, Erik Henriksson, Veronika Laippala +1

cs.CL2023

Multi-CrossRE A Multi-Lingual Multi-Domain Dataset for Relation Extraction

Elisa Bassignana, Filip Ginter, Sampo Pyysalo +2