3 papers
cs.LG2026
Randomized Least Squares Value Iteration itself is Joint Differentially Private
Haiyang Lu, Pratik Gajane, Shaojie Bai +1
As reinforcement learning (RL) increasingly applies to sensitive domains, such as health care and recommendation systems, privacy-preserving techniques have become essential to pro…
cs.LG2026
ATPO: Adaptive Tree Policy Optimization for Multi-Turn Medical Dialogue
Ruike Cao, Shaojie Bai, Fugen Yao +3
Effective information seeking in multi-turn medical dialogues is critical for accurate diagnosis, especially when dealing with incomplete information. Aligning Large Language Model…
cs.LG2024
Near-Optimal Reinforcement Learning with Shuffle Differential Privacy
Shaojie Bai, Mohammad Sadegh Talebi, Chengcheng Zhao +2
Reinforcement learning (RL) is a powerful tool for sequential decision-making, but its application is often hindered by privacy concerns arising from its interaction data. This cha…