2 papers
cs.CL2026
Neuron-Guided Fine-Tuning: Unlocking Efficient Alignment Mechanisms for Large Language Models
Zeyu Wu, Junchao Wu, Shudong Liu +8
Existing Supervised Fine-Tuning paradigms, particularly Full Parameter Fine-Tuning are often plagued by parameter redundancy, inconsistent data quality, and catastrophic forgetting…
cs.CL2026
UniRRM: Unified Reasoning Reward Models Across Languages and Evaluation Paradigms
Peng Lai, Yichao Du, Junchao Wu +6
Reinforcement learning (RL) excels on tasks with verifiable rewards, but in open-ended tasks, the reliability of reward models remains a key challenge. Existing solutions either de…