4 papers
Learning-Zone Energy: Online Data Selection for Efficient RL Post-Training
Peng Cui, Boyao Yang, Jun Zhu
Reinforcement Learning (RL) post-training has emerged as the dominant paradigm for eliciting mathematical reasoning in Large Language Models (LLMs), yet prevailing techniques such…
Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning
Peng Cui, Boyao Yang, Jun Zhu
Reinforcement learning post-training has substantially improved the reasoning accuracy of vision-language models, yet the resulting policies remain poorly calibrated. Terminal corr…
Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification
Yichi Zhang, Nabeel Seedat, Yinpeng Dong +3
As LLM-powered agents have been used for high-stakes decision-making, such as clinical diagnosis, it becomes critical to develop reliable verification of their decisions to facilit…
Deep sub-ensembles meets quantile regression: uncertainty-aware imputation for time series
Ying Liu, Peng Cui, Wenbo Hu +1
Real-world time series data often exhibits substantial missing values, posing challenges for advanced analysis. A common approach to addressing this issue is imputation, where the…