1 paper
Peng Sun, Xiangyu Zhang, Duan Wu +5
Accurate evaluation of user satisfaction is critical for iterative development of conversational AI. However, for open-ended assistants, traditional A/B testing lacks reliable metr…