1 paper
Zairah Mustahsan, Abel Lim, Megna Anand +2
As large language models become components of larger agentic systems, evaluation reliability becomes critical: unreliable sub-agents introduce brittleness into downstream system be…