2 papers
cs.LG2026
DOG-DPO:Dynamic Optimization in Geometry for Safety Alignment
Yi Nian, Tiankai Yang, Yudi Zhang +7
Safety alignment for large language models relies on preference data, but current pipelines often train on large, redundant datasets. Existing data selection methods typically scor…
cs.AI2026
Federated Reasoning Distillation Framework with Model Learnability-Aware Data Allocation
Wei Guo, Siyuan Lu, Xiangdong Ran +8
Data allocation plays a critical role in federated large language model (LLM) and small language models (SLMs) reasoning collaboration. Nevertheless, existing data allocation metho…