Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
Latent Programming Horizons in Coding Agents
André Silva, Han Tu, Martin Monperrus
A coding agent solving a software-engineering task spends dozens of steps reasoning, editing code, and running tests, yet little is known about what the underlying language model i…
cs.LG2026
On Randomness in Agentic Evals
Bjarni Haukur Bjarnason, André Silva, Martin Monperrus
Agentic systems are evaluated on benchmarks where agents interact with environments to solve tasks. Most papers report a pass@1 score computed from a single run per task, assuming…