1 paper
Muyu Pan, Shu Zhao, Nan Zhang +4
This paper investigates large language model (LLM) abstention learning, specifically using ternary reward, which incentivize truthfulness in large language models. This paper exten…