1 paper
Hamed Taherkhani, Mohammad Abdollahi, Melika Sepidband +3
Large language models (LLMs) are increasingly used in coding tasks, but their ability to reason about code execution remains unclear. Existing repository-level QA benchmarks mainly…