Showing cs.CLShow all
2 papers · 1 filter
cs.CL2025
A Use-Case Specific Dataset for Measuring Dimensions of Responsible Performance in LLM-generated Text
Alicia Sagae, Chia-Jung Lee, Sandeep Avula +2
Current methods for evaluating large language models (LLMs) typically focus on high-level tasks such as text generation, without targeting a particular AI application. This approac…
cs.CL2025
Who's Asking? Evaluating LLM Robustness to Inquiry Personas in Factual Question Answering
Nil-Jana Akpinar, Chia-Jung Lee, Vanessa Murdock +1
Large Language Models (LLMs) should answer factual questions truthfully, grounded in objective knowledge, regardless of user context such as self-disclosed personal information, or…