2 papers
cs.CL2026
FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios
Yutao Hou, Yihan Jiang, Yuhan Xie +5
Large language models (LLMs) are increasingly applied in financial scenarios. However, they may produce harmful outputs, including facilitating illegal activities or unethical beha…
cs.CR2025
Automated Penetration Testing with LLM Agents and Classical Planning
Lingzhi Wang, Xinyi Shi, Ziyu Li +8
While penetration testing plays a vital role in cybersecurity, achieving fully automated, hands-off-the-keyboard execution remains a significant research challenge. In this paper,…