2 papers
cs.LG2024
Belief-Enriched Pessimistic Q-Learning against Adversarial State Perturbations
Xiaolin Sun, Zizhan Zheng
Reinforcement learning (RL) has achieved phenomenal success in various domains. However, its data-driven nature also introduces new vulnerabilities that can be exploited by malicio…
cs.LG2024
Enhancing LLM Safety via Constrained Direct Preference Optimization
Zixuan Liu, Xiaolin Sun, Zizhan Zheng
The rapidly increasing capabilities of large language models (LLMs) raise an urgent need to align AI systems with diverse human preferences to simultaneously enhance their usefulne…