1 paper · 1 filter
Kai Wang, Yihao Zhang, Meng Sun
The honesty of large language models (LLMs) is a critical alignment challenge, especially as advanced systems with chain-of-thought (CoT) reasoning may strategically deceive humans…