19 papers
PRWeaver: Evaluating LLM-Based Code Auditors against Long-Horizon Malicious Pull Requests
Yuekun Wang, Mingfei Cheng, Xiaofei Xie
LLM-based code auditors are increasingly integrated into pull-request (PR) workflows, yet their reliability against adversarial changes distributed across repository evolution rema…
EvoEye: Self-Evolving Runtime Monitoring for Autonomous Driving Systems
Mingfei Cheng, Lionel Briand, Xiaofei Xie
Runtime monitoring is essential for detecting impending hazards in autonomous driving systems (ADSs). However, existing ADS runtime monitors have fixed detection capabilities: rule…
Diagnosis-Driven Automatic Repair for Agentic Workflow via Symbolic Inference
Xuyan Ma, Yawen Wang, Junjie Wang +5
Platform-orchestrated agentic workflows have become a popular paradigm for developing LLM-based applications. However, their reliability remains a major challenge due to the uncert…
Where Did It Go Wrong? Capability-Oriented Failure Attribution for Vision-and-Language Navigation Agents
Jianming Chen, Yawen Wang, Junjie Wang +4
Embodied agents in safety-critical applications such as Vision-Language Navigation (VLN) rely on multiple interdependent capabilities (e.g., perception, memory, planning, decision)…
AutoEG: Exploiting Known Third-Party Vulnerabilities in Black-Box Web Applications
Ruozhao Yang, Mingfei Cheng, Gelei Deng +3
Large-scale web applications are widely deployed with complex third-party components, inheriting security risks arising from component vulnerabilities. Security assessment is there…
Foundation Models for Autonomous Driving System: An Initial Roadmap
Xiongfei Wu, Mingfei Cheng, Xiaoning Ren +8
Recent advances in foundation models (FMs), including large language models (LLMs), vision-language models (VLMs), and world models, have opened new opportunities for autonomous dr…