2 papers
cs.LG2026
Learning from Synthetic Data Improves Multi-hop Reasoning
Anmol Kabra, Yilun Yin, Albert Gong +6
Reinforcement Learning (RL) has been shown to significantly boost reasoning capabilities of large language models (LLMs) in math, coding, and multi-hop reasoning tasks. However, RL…
cs.LG2025
PhantomWiki: On-Demand Datasets for Reasoning and Retrieval Evaluation
Albert Gong, KamilÄ StankeviÄiÅ«tÄ, Chao Wan +6
High-quality benchmarks are essential for evaluating reasoning and retrieval capabilities of large language models (LLMs). However, curating datasets for this purpose is not a perm…