Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
Sharpness-Aware Minimization in Logit Space Efficiently Enhances Direct Preference Optimization
Haocheng Luo, Zehang Deng, Thanh-Toan Do +3
Direct Preference Optimization (DPO) has emerged as a popular algorithm for aligning pretrained large language models with human preferences, owing to its simplicity and training s…
cs.LG2025
Differentially Private Neural Network Training Under the Hidden State Assumption
Ding Chen, Chen Liu, Haochen Luo +1
Current differentially private learning paradigms face a severe utility bottleneck: DP-SGD degrades performance through noise accumulation over training steps, while aggregation-ba…