NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (15)

cs.PL2021

CompilerGym: Robust, Performant Compiler Optimization Environments for AI Research

Chris Cummins, Bram Wasti, Jiadong Guo +9

cs.CL2025

A State-of-the-Art SQL Reasoning Model using RLVR

Alnur Ali, Ashutosh Baheti, Jonathan Chang +13

cs.LG2020

Control-Aware Representations for Model-based Reinforcement Learning

Brandon Cui, Yinlam Chow, Mohammad Ghavamzadeh

cs.LG2024

Critique-out-Loud Reward Models

Zachary Ankner, Mansheej Paul, Brandon Cui +2

cs.LG2026

Introspective X Training: Feedback Conditioning Improves Scaling Across all LLM Training Stages

Brandon Cui, Ximing Lu, Jaehun Jung +7

cs.AI2022

K-level Reasoning for Zero-Shot Coordination in Hanabi

Brandon Cui, Hengyuan Hu, Luis Pineda +1

cs.LG2026

DeltaPrompts: Escaping the Zero-Delta Trap in Multimodal Distillation

Jaehun Jung, Hyunwoo Kim, Brandon Cui +4

cs.AI2022

Self-Explaining Deviations for Coordination

Hengyuan Hu, Samuel Sokota, David Wu +4

cs.LG2020

Variational Model-based Policy Optimization

Yinlam Chow, Brandon Cui, MoonKyung Ryu +1

cs.RO2026

How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning

Bosung Kim, Ruiyi Wang, David Acuna +5

cs.LG2026

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

NVIDIA, :, Amala Sanjay Deshmukh +204

cs.AI2021

Off-Belief Learning

Hengyuan Hu, Adam Lerer, Brandon Cui +4

cs.AI2022

Learning Space Partitions for Path Planning

Kevin Yang, Tianjun Zhang, Chris Cummins +6

cs.AI2026

Golden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Text

Ximing Lu, David Acuna, Jaehun Jung +12

cs.LG2026

ProCUA-SFT Technical Report

Jaehun Jung, Ximing Lu, Brandon Cui +11