8 papers
Test-Time Verification for Text-to-SQL via Outcome Reward Models
Mattia Tritto, Giuseppe Farano, Dario Di Palma +4
Improving the reliability of large language models (LLMs) at inference time is a central challenge in structured reasoning tasks such as Text-to-SQL. Common test-time inference str…
Exploring Approaches for Detecting Memorization of Recommender System Data in Large Language Models
Antonio Colacicco, Vito Guida, Dario Di Palma +2
Large Language Models (LLMs) are increasingly applied in recommendation scenarios due to their strong natural language understanding and generation capabilities. However, they are…
Exploring Diversity, Novelty, and Popularity Bias in ChatGPT's Recommendations
Dario Di Palma, Giovanni Maria Biancofiore, Vito Walter Anelli +2
ChatGPT has emerged as a versatile tool, demonstrating capabilities across diverse domains. Given these successes, the Recommender Systems (RSs) community has begun investigating i…
LLMs for Automated Unit Test Generation and Assessment in Java: The AgoneTest Framework
Andrea Lops, Fedelucio Narducci, Azzurra Ragone +2
Unit testing is an essential but resource-intensive step in software development, ensuring individual code units function correctly. This paper introduces AgoneTest, an automated e…
GradeSQL: Test-Time Inference with Outcome Reward Models for Text-to-SQL Generation from Large Language Models
Mattia Tritto, Giuseppe Farano, Dario Di Palma +4
Text-to-SQL, the task of translating natural language questions into SQL queries, has significantly advanced with the introduction of Large Language Models (LLMs), broadening datab…
Do Recommender Systems Really Leverage Multimodal Content? A Comprehensive Analysis on Multimodal Representations for Recommendation
Claudio Pomo, Matteo Attimonelli, Danilo Danese +2
Multimodal Recommender Systems aim to improve recommendation accuracy by integrating heterogeneous content, such as images and textual metadata. While effective, it remains unclear…