3 papers
cs.LG2026
SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data
Carlo Romeo, Girolamo Macaluso, Alessandro Sestini +1
Incorporating prior data into online reinforcement learning accelerates training but typically forces a difficult trade-off between high computational costs and long, multi-stage t…
cs.CV2025
No MoCap Needed: Post-Training Motion Diffusion Models with Reinforcement Learning using Only Textual Prompts
Girolamo Macaluso, Lorenzo Mandelli, Mirko Bicchierai +2
Diffusion models have recently advanced human motion generation, producing realistic and diverse animations from textual prompts. However, adapting these models to unseen actions o…
cs.LG2025
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning
Carlo Romeo, Girolamo Macaluso, Alessandro Sestini +1
High update-to-data (UTD) ratio algorithms in reinforcement learning (RL) improve sample efficiency but incur high computational costs, limiting real-world scalability. We propose…