1 paper
Woo Seob Sim, Yu Rang Park
Prompt-level safety probes for large language models use hidden-state representations to separate safe from unsafe prompts, but strong average detection performance does not explai…