4 papers
From Reasoning to Code: GRPO Optimization for Underrepresented Languages
Federico Pennino, Bianca Raimondi, Massimo Rondelli +2
Generating accurate and executable code using Large Language Models (LLMs) remains a significant challenge for underrepresented programming languages, such as Prolog and Lisp, due…
Do not copy and paste! Rewriting strategies for code retrieval
Andrea Gurioli, Federico Pennino, Maurizio Gabbrielli
Embedding-based code retrieval often suffers when encoders overfit to surface syntax. Prior work mitigates this by using LLMs to rephrase queries and corpora into a normalized styl…
MoSE: Hierarchical Self-Distillation Enhances Early Layer Embeddings
Andrea Gurioli, Federico Pennino, João Monteiro +1
Deploying language models often requires navigating accuracy vs. performance trade-offs to meet latency constraints while preserving utility. Traditional model distillation reduces…
Optimizing the Training Diet: Data Mixture Search for Robust Time Series Forecasting
Federico Pennino, Maurizio Gabbrielli
The standard paradigm for training deep learning models on sensor data assumes that more data is always better. However, raw sensor streams are often imbalanced and contain signifi…