1 paper
Yunan Lu, Luigi Liu, Omar Yahia +2
Evaluating LLM-based agents remains challenging because identifying meaningful failure cases often requires substantial human effort to design realistic test scenarios. Prior works…