1 paper
Priyanshu Kumar, Elaine Lau, Saranya Vijayakumar +9
For safety reasons, large language models (LLMs) are trained to refuse harmful user instructions, such as assisting dangerous activities. We study an open question in this work: do…