1 paper
Ihor Stepanov, Aleksandr Smechov
Real-time safety filtering for large language model (LLM) applications requires classifiers that can detect unsafe prompts, toxic language, jailbreak attempts, and unsafe responses…