1 paper · 1 filter
Zairah Mustahsan, Abel Lim, Megna Anand +2
As large language models become components of larger agentic systems, evaluation reliability becomes critical: unreliable sub-agents introduce brittleness into downstream system be…