13 papers
PRWeaver: Evaluating LLM-Based Code Auditors against Long-Horizon Malicious Pull Requests
Yuekun Wang, Mingfei Cheng, Xiaofei Xie
LLM-based code auditors are increasingly integrated into pull-request (PR) workflows, yet their reliability against adversarial changes distributed across repository evolution rema…
EvoEye: Self-Evolving Runtime Monitoring for Autonomous Driving Systems
Mingfei Cheng, Lionel Briand, Xiaofei Xie
Runtime monitoring is essential for detecting impending hazards in autonomous driving systems (ADSs). However, existing ADS runtime monitors have fixed detection capabilities: rule…
Ensemble-Based Uncertainty Estimation for Code Correctness Estimation
Yunxiang Wei, Tianlin Li, Yuwei Zheng +6
Large language models (LLMs) have demonstrated remarkable capabilities in generating programs from natural language descriptions, yet ensuring their correctness without an external…
Hidden Reliability Risks in Large Language Models: Systematic Identification of Precision-Induced Output Disagreements
Yifei Wang, Tianlin Li, Xiaohan Zhang +4
Large language models (LLMs) are increasingly deployed under diverse numerical precision configurations, including standard floating-point formats (e.g., bfloat16 and float16) and…
AutoEG: Exploiting Known Third-Party Vulnerabilities in Black-Box Web Applications
Ruozhao Yang, Mingfei Cheng, Gelei Deng +3
Large-scale web applications are widely deployed with complex third-party components, inheriting security risks arising from component vulnerabilities. Security assessment is there…
Foundation Models for Autonomous Driving System: An Initial Roadmap
Xiongfei Wu, Mingfei Cheng, Xiaoning Ren +8
Recent advances in foundation models (FMs), including large language models (LLMs), vision-language models (VLMs), and world models, have opened new opportunities for autonomous dr…