1 paper
Jinglan Gong, Jiefan Lu, Hewei Guo +5
Evaluating large language models (LLMs) as multi-turn conversational partners requires probing capabilities that single-turn benchmarks miss: persona consistency, evolving intent t…