collaborators

5 papers

cs.CL2026

BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams

João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz +2

Although Large Language Models (LLMs) excel in many tasks, their assessment in Portuguese has received less attention, particularly for open-ended, discursive tasks that demand dee…

cs.CL2026

Synthetic Rewriting as a Quality Multiplier: Evidence from Portuguese Continued Pretraining

Thales Sales Almeida, Rodrigo Nogueira, Hélio Pedrini

Synthetic data generation through document rewriting has emerged as a promising technique for improving language model pretraining, yet most studies focus on English and do not sys…

cs.CL2025

Curió-Edu 7B: Examining Data Selection Impacts in LLM Continued Pretraining

Thales Sales Almeida, Rodrigo Nogueira, Hélio Pedrini

Continued pretraining extends a language model's capabilities by further exposing it to additional data, often tailored to a specific linguistic or domain context. This strategy ha…

cs.CL2025

PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese

Thales Sales Almeida, Ramon Pires, Hugo Abonizio +2

Large Language Models (LLMs) exhibit significant variations in performance across linguistic and cultural contexts, underscoring the need for systematic evaluation in diverse langu…

cs.CL2025

Building High-Quality Datasets for Portuguese LLMs: From Common Crawl Snapshots to Industrial-Grade Corpora

Thales Sales Almeida, Rodrigo Nogueira, Helio Pedrini

The performance of large language models (LLMs) is deeply influenced by the quality and composition of their training data. While much of the existing work has centered on English,…