4 papers
On the Hidden Objective Biases of Group-based Reinforcement Learning
Aleksandar Fontana, Marco Simoni, Giulio Rossolini +2
Group-based reinforcement learning methods, like Group Relative Policy Optimization (GRPO), are widely used nowadays to post-train large language models. Despite their empirical su…
GTPO: Stabilizing Group Relative Policy Optimization via Gradient and Entropy Control
Marco Simoni, Aleksandar Fontana, Giulio Rossolini +2
Group Relative Policy Optimization (GRPO) is a promising policy-based approach for Large Language Model alignment, yet its performance is often limited by training instability and…
TITAN: Graph-Executable Reasoning for Cyber Threat Intelligence
Marco Simoni, Aleksandar Fontana, Andrea Saracino +1
TITAN (Threat Intelligence Through Automated Navigation) is a framework that connects natural-language cyber threat queries with executable reasoning over a structured knowledge gr…
Improving LLM Reasoning for Vulnerability Detection via Group Relative Policy Optimization
Marco Simoni, Aleksandar Fontana, Giulio Rossolini +1
Improving and understanding the training dynamics and reasoning of Large Language Models (LLMs) has become essential for their deployment in AI-based security tools, such as softwa…