1 paper
Omar Choukrani, Idriss Malek, Daniil Orel +5
When an interactive benchmark reports a single success rate for a language-model agent, it is rarely clear what that number measures. A failure can come from perception, ambiguous…