1 paper
Dengjia Zhang, Xiaoou Liu, Lu Cheng +3
Large language models (LLMs) are increasingly deployed as multi-step decision-making agents, where effective reward design is essential for guiding learning. Although recent work e…