Showing cs.CLShow all
2 papers · 1 filter
cs.CL2025
UniDetox: Universal Detoxification of Large Language Models via Dataset Distillation
Huimin Lu, Masaru Isonuma, Junichiro Mori +1
We present UniDetox, a universally applicable method designed to mitigate toxicity across various large language models (LLMs). Previous detoxification methods are typically model-…
cs.CL2024
Towards Transfer Unlearning: Empirical Evidence of Cross-Domain Bias Mitigation
Huimin Lu, Masaru Isonuma, Junichiro Mori +1
Large language models (LLMs) often inherit biases from vast amounts of training corpora. Traditional debiasing methods, while effective to some extent, do not completely eliminate…