Showing cs.CLShow all
2 papers · 1 filter
cs.CL2026
Your Language Model Secretly Contains Personality Subnetworks
Ruimeng Ye, Zihan Wang, Zinan Ling +4
Humans shift between different personas depending on social context. Large Language Models (LLMs) demonstrate a similar flexibility in adopting different personas and behaviors. Ex…
cs.CL2025
Weak-to-Strong Generalization beyond Accuracy: a Pilot Study in Safety, Toxicity, and Legal Reasoning
Ruimeng Ye, Yang Xiao, Bo Hui
As large language models (LLMs) continue to advance, ensuring their alignment with human values becomes increasingly critical. Traditional alignment methods heavily rely on human f…