2 papers
cs.SE2026
VibeCheck: Assessing the Quality of LLM-Generated Unit Tests: A Multi-agent Empirical Study across Heterogeneous Repositories
Anika Tabassum, Mushahid Intesum, Md. Fahim Arefin +1
LLM-based IDE agents are increasingly used to generate repository-grounded unit tests, yet common evaluations often rely on execution success or coverage. These metrics can miss de…
cs.SE2026
A-ProS: Towards Reliable Autonomous Programming Through Multi-Model Feedback
Anika Tabassum, Md Sifat Hossain, Md. Fahim Arefin +2
Large Language Models (LLMs) demonstrate strong potential for automated code generation, yet their ability to iteratively refine solutions using execution feedback remains underexp…