2 papers
cs.CL2026
An Emergent Mirage: Is Emergent Misalignment and Realignment Indeed a Robust Phenomenon?
Abhinav Rao, Liancheng Gong, Bin Hu +1
Recent work has reported Emergent Misalignment (EM), where language models fine-tuned on narrow, domain-specific misaligned datasets abruptly acquire broadly misaligned behavior, a…
cs.CL2026
Persuasion Index: A Theory-Guided Framework for Persuasion Analysis
Liancheng Gong, Zhiyang Wang, Yiwei Xu +1
Identifying persuasive rhetorical cues is critical across domains, from detecting information manipulation and improving AI safety to advancing public health communication. We prop…