2 papers
cs.LG2025
Offline Clustering of Preference Learning with Active-data Augmentation
Jingyuan Liu, Fatemeh Ghaffari, Xuchuang Wang +3
Preference learning from pairwise feedback is a widely adopted framework in applications such as reinforcement learning with human feedback and recommendations. In many practical s…
cs.LG2025
Offline Clustering of Linear Bandits: The Power of Clusters under Limited Data
Jingyuan Liu, Zeyu Zhang, Xuchuang Wang +4
Contextual multi-armed bandit is a fundamental learning framework for making a sequence of decisions, e.g., advertising recommendations for a sequence of arriving users. Recent wor…