1 paper · 1 filter
Muyu Pan, Shu Zhao, Nan Zhang +4
This paper investigates large language model (LLM) abstention learning, specifically using ternary reward, which incentivize truthfulness in large language models. This paper exten…