1 citations · 1 across the 22 of their papers we have counts for
4 papers · 1 filter
Online Preference Alignment for Language Models via Count-based Exploration
Chenjia Bai, Yang Zhang, Shuang Qiu +3
Reinforcement Learning from Human Feedback (RLHF) has shown great potential in fine-tuning Large Language Models (LLMs) to align with human preferences. Existing methods perform pr…
Constrained Ensemble Exploration for Unsupervised Skill Discovery
Chenjia Bai, Rushuai Yang, Qiaosheng Zhang +4
Unsupervised Reinforcement Learning (RL) provides a promising paradigm for learning useful behaviors via reward-free per-training. Existing methods for unsupervised RL mainly condu…
Contrastive Representation for Data Filtering in Cross-Domain Offline Reinforcement Learning
Xiaoyu Wen, Chenjia Bai, Kang Xu +4
Cross-domain offline reinforcement learning leverages source domain data with diverse transition dynamics to alleviate the data requirement for the target domain. However, simply m…
Regularized Conditional Diffusion Model for Multi-Task Preference Alignment
Xudong Yu, Chenjia Bai, Haoran He +2
Sequential decision-making is desired to align with human intents and exhibit versatility across various tasks. Previous methods formulate it as a conditional generation process, u…