3 papers
cs.AI2026
Early Diagnosis of Wasted Computation in Multi-Agent LLM Systems via Failure-Aware Observability
Xianyou Li, Weiran Yan, Yichao Wu +4
Failure-aware observability diagnoses wasted computation in multi-agent LLM systems before final-answer evaluation can explain what went wrong. We propose a trace-based framework f…
cs.CR2026
SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents
Hao Cheng, Changtao Miao, Tianle Song +21
Autonomous LLM agents increasingly operate in stateful environments where they access tools, files, memory, and external services. While such capabilities enable complex real-world…
cs.CR2026
MAS-SZZ: Multi-Agentic SZZ Algorithm for Vulnerability-Inducing Commit Identification
Sicong Cao, Jinxuan Xu, Le Yu +4
Accurate vulnerability-inducing commit identification serves as a foundation for a series of software security tasks, such as vulnerability detection and affected version analysis.…