2 papers
cs.LG2025
DiffLM: Controllable Synthetic Data Generation via Diffusion Language Models
Ying Zhou, Xinyao Wang, Yulei Niu +6
Recent advancements in large language models (LLMs) have significantly enhanced their knowledge and generative capabilities, leading to a surge of interest in leveraging LLMs for h…
cs.CL2024
AIPO: Improving Training Objective for Iterative Preference Optimization
Yaojie Shen, Xinyao Wang, Yulei Niu +5
Preference Optimization (PO), is gaining popularity as an alternative choice of Proximal Policy Optimization (PPO) for aligning Large Language Models (LLMs). Recent research on ali…