papers
Publications (3)
cs.AI2021
PoBRL: Optimizing Multi-Document Summarization by Blending Reinforcement Learning Policies
Andy Su, Difei Su, John M. Mulvey +1
We propose a novel reinforcement learning based framework PoBRL for solving multi-document summarization. PoBRL jointly optimizes over the following three objectives necessary for…
cs.AI2026
dTRPO: Trajectory Reduction in Policy Optimization of Diffusion Large Language Models
Wenxuan Zhang, Lemeng Wu, Changsheng Zhao +11
Diffusion Large Language Models (dLLMs) introduce a new paradigm for language generation, which in turn presents new challenges for aligning them with human preferences. In this wo…
cs.LG2020
ConQUR: Mitigating Delusional Bias in Deep Q-learning
Andy Su, Jayden Ooi, Tyler Lu +2
Delusional bias is a fundamental source of error in approximate Q-learning. To date, the only techniques that explicitly address delusion require comprehensive search using tabular…