1 paper
Danting Zhang, Bei Peng, Robert Loftin
Large language models (LLMs) demonstrate strong performance on standard content moderation benchmarks. However, these benchmarks often aggregate multiple moderation criteria into a…