1 paper · 1 filter
Lijun Zhang, Lin Li, Wei Wei +5
When fine-tuning pre-trained Language Models (LMs) to exhibit desired behaviors, maintaining control over risk is critical for ensuring both safety and trustworthiness. Most existi…