7 papers
Where Did It Go Wrong? Capability-Oriented Failure Attribution for Vision-and-Language Navigation Agents
Jianming Chen, Yawen Wang, Junjie Wang +4
Embodied agents in safety-critical applications such as Vision-Language Navigation (VLN) rely on multiple interdependent capabilities (e.g., perception, memory, planning, decision)…
AutoEG: Exploiting Known Third-Party Vulnerabilities in Black-Box Web Applications
Ruozhao Yang, Mingfei Cheng, Gelei Deng +3
Large-scale web applications are widely deployed with complex third-party components, inheriting security risks arising from component vulnerabilities. Security assessment is there…
PentestEval: Benchmarking LLM-based Penetration Testing with Modular and Stage-Level Design
Ruozhao Yang, Mingfei Cheng, Gelei Deng +3
Penetration testing is essential for assessing and strengthening system security against real-world threats, yet traditional workflows remain highly manual, expertise-intensive, an…
PatchFuzz: Patch Fuzzing for JavaScript Engines
Junjie Wang, Yuhan Ma, Xiaofei Xie +2
Patch fuzzing is a technique aimed at identifying vulnerabilities that arise from newly patched code. While researchers have made efforts to apply patch fuzzing to testing JavaScri…
Decictor: Towards Evaluating the Robustness of Decision-Making in Autonomous Driving Systems
Mingfei Cheng, Yuan Zhou, Xiaofei Xie +3
Autonomous Driving System (ADS) testing is crucial in ADS development, with the current primary focus being on safety. However, the evaluation of non-safety-critical performance, p…
Understanding Individual Agent Importance in Multi-Agent System via Counterfactual Reasoning
Jianming Chen, Yawen Wang, Junjie Wang +4
Explaining multi-agent systems (MAS) is urgent as these systems become increasingly prevalent in various applications. Previous work has proveided explanations for the actions or s…