1 paper
Jian Mu, Tianyi Lin, Chengwei Qin +2
Large language models are increasingly deployed in multi-turn interactive settings where users or environments can iteratively provide lightweight feedback. Unfortunately, optimizi…