papers

Publications (78)

cs.CL2021

Generating Synthetic Text Data to Evaluate Causal Inference Methods

Zach Wood-Doughty, Ilya Shpitser, Mark Dredze

cs.CL2017

Harmonic Grammar, Optimality Theory, and Syntax Learnability: An Empirical Exploration of Czech Word Order

Ann Irvine, Mark Dredze

cs.AI2026

How to Interpret Agent Behavior

Jie Gao, Kaiser Sun, Jen-tse Huang +8

cs.CL2024

Schema-Driven Information Extraction from Heterogeneous Tables

Fan Bai, Junmo Kang, Gabriel Stanovsky +3

cs.CL2020

Phenotyping of Clinical Notes with Improved Document Classification Models Using Contextualized Neural Language Models

Andriy Mulyar, Elliot Schumacher, Masoud Rouhizadeh +1

cs.CL2025

Understanding and Mitigating Risks of Generative AI in Financial Services

Sebastian Gehrmann, Claire Huang, Xian Teng +9

cs.CL2026

On the Failure of Latent State Persistence in Large Language Models

Jen-tse Huang, Kaiser Sun, Wenxuan Wang +1

cs.CL2026

Knowing But Not Doing: Convergent Morality and Divergent Action in LLMs

Jen-tse Huang, Jiantong Qin, Xueli Qiu +3

cs.LG2025

Can Optimization Trajectories Explain Multi-Task Transfer?

David Mueller, Mark Dredze, Nicholas Andrews

cs.SI2020

The Twitter Social Mobility Index: Measuring Social Distancing Practices from Geolocated Tweets

Paiheng Xu, Mark Dredze, David A. Broniatowski

cs.CL2019

Beto, Bentz, Becas: The Surprising Cross-Lingual Effectiveness of BERT

Shijie Wu, Mark Dredze

cs.CL2024

MixCE: Training Autoregressive Language Models by Mixing Forward and Reverse Cross-Entropies

Shiyue Zhang, Shijie Wu, Ozan Irsoy +4

cs.CL2022

What Makes Data-to-Text Generation Hard for Pretrained Language Models?

Moniba Keymanesh, Adrian Benton, Mark Dredze

cs.CL2017

Feature Generation for Robust Semantic Role Labeling

Travis Wolfe, Mark Dredze, Benjamin Van Durme

cs.CL2025

RAG LLMs are Not Safer: A Safety Analysis of Retrieval-Augmented Generation for Large Language Models

Bang An, Shiyue Zhang, Mark Dredze

cs.CL2025

Can one size fit all?: Measuring Failure in Multi-Document Summarization Domain Transfer

Alexandra DeLucia, Mark Dredze

cs.CL2024

Are Clinical T5 Models Better for Clinical Text?

Yahan Li, Keith Harrigian, Ayah Zirikly +1

cs.CL2024

Gender Bias in Decision-Making with Large Language Models: A Study of Relationship Conflicts

Sharon Levy, William D. Adler, Tahilin Sanchez Karver +2

stat.AP2015

Combining Search, Social Media, and Traditional Data Sources to Improve Influenza Surveillance

Mauricio Santillana, Andre T. Nguyen, Mark Dredze +2

cs.LG2021

Faithful and Plausible Explanations of Medical Code Predictions

Zach Wood-Doughty, Isabel Cachola, Mark Dredze

cs.CL2024

Evaluating Biases in Context-Dependent Health Questions

Sharon Levy, Tahilin Sanchez Karver, William D. Adler +2

cs.CL2018

Challenges of Using Text Classifiers for Causal Inference

Zach Wood-Doughty, Ilya Shpitser, Mark Dredze

cs.CL2022

Do Text-to-Text Multi-Task Learners Suffer from Task Conflict?

David Mueller, Nicholas Andrews, Mark Dredze

cs.CL2021

User Factor Adaptation for User Embedding via Multitask Learning

Xiaolei Huang, Michael J. Paul, Robin Burke +2

cs.CL2021

Using Noisy Self-Reports to Predict Twitter User Demographics

Zach Wood-Doughty, Paiheng Xu, Xiao Liu +1

cs.CL2020

Sources of Transfer in Multilingual Named Entity Recognition

David Mueller, Nicholas Andrews, Mark Dredze

cs.CL2024

DnDScore: Decontextualization and Decomposition for Factuality Verification in Long-Form Text Generation

Miriam Wanner, Benjamin Van Durme, Mark Dredze

cs.CL2021

On the State of Social Media Data for Mental Health Research

Keith Harrigian, Carlos Aguirre, Mark Dredze

cs.SI2021

Twitter and Facebook posts about COVID-19 are less likely to spread false and low-credibility content compared to other health topics

David A. Broniatowski, Daniel Kerchner, Fouzia Farooq +4

cs.CL2021

Fine-tuning Encoders for Improved Monolingual and Zero-shot Polylingual Neural Topic Modeling

Aaron Mueller, Mark Dredze

cs.CL2025

MedScore: Generalizable Factuality Evaluation of Free-Form Medical Answers by Domain-adapted Claim Decomposition and Verification

Heyuan Huang, Alexandra DeLucia, Vijay Murari Tiyyala +1

cs.AI2026

FIRE-Bench: Evaluating AI Agents on the Rediscovery of Scientific Insights

Zhen Wang, Fan Bai, Zhongyan Luo +9

cs.AI2026

Evaluating Implicit Biases in LLM Reasoning through Logic Grid Puzzles

Fatima Jahara, Mark Dredze, Sharon Levy

cs.CL2020

Demographic Representation and Collective Storytelling in the Me Too Twitter Hashtag Activism Movement

Aaron Mueller, Zach Wood-Doughty, Silvio Amir +2

cs.LG2022

Then and Now: Quantifying the Longitudinal Validity of Self-Disclosed Depression Diagnoses

Keith Harrigian, Mark Dredze

cs.CL2026

Task Matters: Knowledge Requirements Shape LLM Responses to Context-Memory Conflict

Kaiser Sun, Fan Bai, Mark Dredze

cs.HC2025

Efficiency with Rigor! A Trustworthy LLM-powered Workflow for Qualitative Data Analysis

Jie Gao, Zhiyao Shu, Shun Yi Yeo +4

cs.CL2022

Enriching Unsupervised User Embedding via Medical Concepts

Xiaolei Huang, Franck Dernoncourt, Mark Dredze

cs.CL2017

Improving Named Entity Recognition for Chinese Social Media with Word Segmentation Representation Learning

Nanyun Peng, Mark Dredze

cs.CL2025

Amuro and Char: Analyzing the Relationship between Pre-Training and Fine-Tuning of Large Language Models

Kaiser Sun, Mark Dredze

cs.LG2024

Transferring Fairness using Multi-Task Learning with Limited Demographic Information

Carlos Aguirre, Mark Dredze

cs.CE2019

Visual Attention Model for Cross-sectional Stock Return Prediction and End-to-End Multimodal Market Representation Learning

Ran Zhao, Yuntian Deng, Mark Dredze +3

cs.CL2015

Approximation-Aware Dependency Parsing by Belief Propagation

Matthew R. Gormley, Mark Dredze, Jason Eisner

cs.CL2022

Using Open-Ended Stressor Responses to Predict Depressive Symptoms across Demographics

Carlos Aguirre, Mark Dredze, Philip Resnik

cs.CL2026

Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs

Kaiser Sun, Xiaochuang Yuan, Hongjun Liu +4

cs.CL2021

Gender and Racial Fairness in Depression Research using Social Media

Carlos Aguirre, Keith Harrigian, Mark Dredze

cs.SI2016

Twitter as a Source of Global Mobility Patterns for Social Good

Mark Dredze, Manuel García-Herranz, Alex Rutherford +1

cs.CL2021

Cross-Lingual Transfer in Zero-Shot Cross-Language Entity Linking

Elliot Schumacher, James Mayfield, Mark Dredze

cs.CL2021

Everything Is All It Takes: A Multipronged Strategy for Zero-Shot Cross-Lingual Information Extraction

Mahsa Yarmohammadi, Shijie Wu, Marc Marone +10

cs.CL2026

Artificial Intolerance: Stigmatizing Language in Clinical Documentation Skews Large Language Model Decision-Making

Jen-tse Huang, Didi Zhou, Faith Kamau +5

cs.CY2025

Using large language models to promote health equity

Emma Pierson, Divya Shanmugam, Rajiv Movva +12

cs.CL2020

Do Explicit Alignments Robustly Improve Multilingual Encoders?

Shijie Wu, Mark Dredze

cs.CY2016

Can Big Media Data Revolutionarize Gun Violence Prevention?

John W. Ayers, Benjamin M. Althouse, Eric C. Leas +2

cs.CL2023

Selecting Shots for Demographic Fairness in Few-Shot Learning with Large Language Models

Carlos Aguirre, Kuleen Sasse, Isabel Cachola +1

cs.CY2026

Same Verdict, Different Reasons: LLM-as-a-Judge and Clinician Disagreement on Medical Chatbot Completeness

Alexandra DeLucia, Heyuan Huang, Sonal Joshi +3

cs.CL2026

Probing Multimodal Large Language Models on Cognitive Biases in Chinese Short-Video Misinformation

Jen-tse Huang, Chang Chen, Shiyang Lai +3

cs.CL2025

LLMs are Better Than You Think: Label-Guided In-Context Learning for Named Entity Recognition

Fan Bai, Hamid Hassanzadeh, Ardavan Saeedi +1

cs.CL2022

The Problem of Semantic Shift in Longitudinal Monitoring of Social Media: A Case Study on Mental Health During the COVID-19 Pandemic

Keith Harrigian, Mark Dredze

cs.CL2021

Improving Zero-Shot Multi-Lingual Entity Linking

Elliot Schumacher, James Mayfield, Mark Dredze

cs.CL2025

Evaluating the Evaluators: Are readability metrics good measures of readability?

Isabel Cachola, Daniel Khashabi, Mark Dredze

cs.CL2025

Making FETCH! Happen: Finding Emergent Dog Whistles Through Common Habitats

Kuleen Sasse, Carlos Aguirre, Isabel Cachola +2

cs.CL2016

Embedding Lexical Features via Low-Rank Tensors

Mo Yu, Mark Dredze, Raman Arora +1

cs.CL2021

Learning to Look Inside: Augmenting Token-Based Encoders with Character-Level Information

Yuval Pinter, Amanda Stent, Mark Dredze +1

cs.HC2020

Examining the Feasibility of Off-the-Shelf Algorithms for Masking Directly Identifiable Information in Social Media Data

Rachel Dorn, Alicia L. Nobles, Masoud Rouhizadeh +1

cs.AI2015

Interactive Knowledge Base Population

Travis Wolfe, Mark Dredze, James Mayfield +4

cs.CL2015

Improved Relation Extraction with Feature-Rich Compositional Embedding Models

Matthew R. Gormley, Mo Yu, Mark Dredze

cs.CL2020

Are All Languages Created Equal in Multilingual BERT?

Shijie Wu, Mark Dredze

cs.LG2023

BloombergGPT: A Large Language Model for Finance

Shijie Wu, Ozan Irsoy, Steven Lu +6

cs.CL2017

Multi-task Domain Adaptation for Sequence Tagging

Nanyun Peng, Mark Dredze

cs.CL2026

Weird Generalization is Weirdly Brittle

Miriam Wanner, Hannah Collison, William Jurayj +3

cs.CL2025

Demo: Statistically Significant Results On Biases and Errors of LLMs Do Not Guarantee Generalizable Results

Jonathan Liu, Haoling Qiu, Jonathan Lasko +3

cs.CL2026

Benchmarking Large Language Models on Answering and Explaining Challenging Medical Questions

Hanjie Chen, Zhouxiang Fang, Yash Singla +1

cs.CL2024

Give me Some Hard Questions: Synthetic Data Generation for Clinical QA

Fan Bai, Keith Harrigian, Joel Stremmel +3

cs.CL2024

A Closer Look at Claim Decomposition

Miriam Wanner, Seth Ebner, Zhengping Jiang +2

cs.SI2016

After Sandy Hook Elementary: A Year in the Gun Control Debate on Twitter

Adrian Benton, Braden Hancock, Glen Coppersmith +2

cs.CL2022

Zero-shot Cross-lingual Transfer is Under-specified Optimization

Shijie Wu, Benjamin Van Durme, Mark Dredze

cs.CL2013

Estimating Confusions in the ASR Channel for Improved Topic-based Language Model Adaptation

Damianos Karakos, Mark Dredze, Sanjeev Khudanpur

cs.CL2023

An Eye on Clinical BERT: Investigating Language Model Generalization for Diabetic Eye Disease Phenotyping

Keith Harrigian, Tina Tang, Anthony Gonzales +2