2 papers
cs.LG2025
Learning Private Representations through Entropy-based Adversarial Training
Tassilo Klein, Moin Nabi
How can we learn a representation with high predictive power while preserving user privacy? We present an adversarial representation learning method for sanitizing sensitive conten…
cs.CL2025
Contrastive Perplexity for Controlled Generation: An Application in Detoxifying Large Language Models
Tassilo Klein, Moin Nabi
The generation of toxic content by large language models (LLMs) remains a critical challenge for the safe deployment of language technology. We propose a novel framework for implic…