1 paper
Dian Yu, Yuheng Zhang, Jiahao Xu +5
Large language models (LLMs) can refine their responses based on feedback, enabling self-improvement through iterative training or test-time refinement. However, existing methods p…