papers
Publications (15)
cs.PL2021
CompilerGym: Robust, Performant Compiler Optimization Environments for AI Research
Chris Cummins, Bram Wasti, Jiadong Guo +9
cs.CL2025
A State-of-the-Art SQL Reasoning Model using RLVR
Alnur Ali, Ashutosh Baheti, Jonathan Chang +13
cs.LG2020
Control-Aware Representations for Model-based Reinforcement Learning
Brandon Cui, Yinlam Chow, Mohammad Ghavamzadeh
cs.LG2024
Critique-out-Loud Reward Models
Zachary Ankner, Mansheej Paul, Brandon Cui +2
cs.LG2026
Introspective X Training: Feedback Conditioning Improves Scaling Across all LLM Training Stages
Brandon Cui, Ximing Lu, Jaehun Jung +7
cs.AI2022
K-level Reasoning for Zero-Shot Coordination in Hanabi
Brandon Cui, Hengyuan Hu, Luis Pineda +1
cs.LG2026
DeltaPrompts: Escaping the Zero-Delta Trap in Multimodal Distillation
Jaehun Jung, Hyunwoo Kim, Brandon Cui +4
cs.AI2022
Self-Explaining Deviations for Coordination
Hengyuan Hu, Samuel Sokota, David Wu +4
cs.LG2020
Variational Model-based Policy Optimization
Yinlam Chow, Brandon Cui, MoonKyung Ryu +1
cs.RO2026
How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning
Bosung Kim, Ruiyi Wang, David Acuna +5
cs.LG2026
Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence
NVIDIA, :, Amala Sanjay Deshmukh +204
cs.AI2021
Off-Belief Learning
Hengyuan Hu, Adam Lerer, Brandon Cui +4
cs.AI2022
Learning Space Partitions for Path Planning
Kevin Yang, Tianjun Zhang, Chris Cummins +6
cs.AI2026
Golden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Text
Ximing Lu, David Acuna, Jaehun Jung +12
cs.LG2026
ProCUA-SFT Technical Report
Jaehun Jung, Ximing Lu, Brandon Cui +11