3 papers
cs.SE2025
ProjectEval: A Benchmark for Programming Agents Automated Evaluation on Project-Level Code Generation
Kaiyuan Liu, Youcheng Pan, Yang Xiang +4
Recently, LLM agents have made rapid progress in improving their programming capabilities. However, existing benchmarks lack the ability to automatically evaluate from users' persp…
cs.SE2025
Human-In-The-Loop Software Development Agents: Challenges and Future Directions
Jirat Pasuksmit, Wannita Takerngsaksiri, Patanamon Thongtanunam +8
Multi-agent LLM-driven systems for software development are rapidly gaining traction, offering new opportunities to enhance productivity. At Atlassian, we deployed Human-in-the-Loo…
cs.SE2025
Human-In-the-Loop Software Development Agents
Wannita Takerngsaksiri, Jirat Pasuksmit, Patanamon Thongtanunam +7
Recently, Large Language Models (LLMs)-based multi-agent paradigms for software engineering are introduced to automatically resolve software development tasks (e.g., from a given i…