1 paper
Kristen Pereira, Neelabh Sinha, Rajat Ghosh +1
Recent advances in frontier large language models have enabled code review agents that operate in open-ended, reasoning-intensive settings. However, the lack of standardized benchm…