collaborators

6 papers

cs.SE2026

CodeGraph: Open-Taxonomy Knowledge Graph for Source Code with Wikidata Grounding

Federico Pennino, Andrea Gurioli, Stefano Zacchiroli +2

Public software repositories, like GitHub and Software Heritage Archive, store billions of files, yet extracting their implicit engineering knowledge ---i.e., the algorithms they i…

cs.SE2026

Efficient and Scalable Provenance Tracking for LLM-Generated Code Snippets

Andrea Gurioli, Davide D'Ascenzo, Federico Pennino +2

Large language models (LLMs) for code completion and generation are increasingly used in software development, yet they may reproduce training examples verbatim and without authors…

cs.SE2026

Do not copy and paste! Rewriting strategies for code retrieval

Andrea Gurioli, Federico Pennino, Maurizio Gabbrielli

Embedding-based code retrieval often suffers when encoders overfit to surface syntax. Prior work mitigates this by using LLMs to rephrase queries and corpora into a normalized styl…

cs.LG2025

Optimizing the Training Diet: Data Mixture Search for Robust Time Series Forecasting

Federico Pennino, Maurizio Gabbrielli

The standard paradigm for training deep learning models on sensor data assumes that more data is always better. However, raw sensor streams are often imbalanced and contain signifi…

cs.LG2025

From Reasoning to Code: GRPO Optimization for Underrepresented Languages

Federico Pennino, Bianca Raimondi, Massimo Rondelli +2

Generating accurate and executable code using Large Language Models (LLMs) remains a significant challenge for underrepresented programming languages, such as Prolog and Lisp, due…

cs.CL2025

MoSE: Hierarchical Self-Distillation Enhances Early Layer Embeddings

Andrea Gurioli, Federico Pennino, João Monteiro +1

Deploying language models often requires navigating accuracy vs. performance trade-offs to meet latency constraints while preserving utility. Traditional model distillation reduces…