5 citations · 26 across the 19 of their papers we have counts for
4 papers · 2 filters
Simple Text Detoxification by Identifying a Linear Toxic Subspace in Language Model Embeddings
Andrew Wang, Mohit Sudhakar, Yangfeng Ji
Large pre-trained language models are often trained on large volumes of internet data, some of which may contain toxic or abusive language. Consequently, language models encode tox…
Perturbing Inputs for Fragile Interpretations in Deep Natural Language Processing
Sanchit Sinha, Hanjie Chen, Arshdeep Sekhon +2
Interpretability methods like Integrated Gradient and LIME are popular choices for explaining natural language model predictions with relative word importance scores. These interpr…
SideControl: Controlled Open-domain Dialogue Generation via Additive Side Networks
Wanyu Du, Yangfeng Ji
Transformer-based pre-trained language models boost the performance of open-domain dialogue systems. Prior works leverage Transformer-based pre-trained language models to generate…
Contextualizing Variation in Text Style Transfer Datasets
Stephanie Schoch, Wanyu Du, Yangfeng Ji
Text style transfer involves rewriting the content of a source sentence in a target style. Despite there being a number of style tasks with available data, there has been limited s…