2 papers
cs.CL2026
Evaluating Reward Model Generalization via Pairwise Maximum Discrepancy Competitions
Shunyang Luo, Peibei Cao, Zhihui Zhu +3
Reward models (RMs) are central to aligning large language models, yet their practical effectiveness hinges on generalization to unseen prompts and shifting distributions. Most exi…
cs.CL2025
MASE: Interpretable NLP Models via Model-Agnostic Saliency Estimation
Zhou Yang, Shunyan Luo, Jiazhen Zhu +1
Deep neural networks (DNNs) have made significant strides in Natural Language Processing (NLP), yet their interpretability remains elusive, particularly when evaluating their intri…