2 papers
cs.CL2026
Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models
Hengyuan Zhang, Zhihao Zhang, Mingyang Wang +26
Mechanistic Interpretability (MI) has emerged as a vital approach to demystify the opaque decision-making of Large Language Models (LLMs). However, existing reviews primarily treat…
cs.AI2025
Falcon: A Cross-Modal Evaluation Dataset for Comprehensive Safety Perception
Qi Xue, Minrui Jiang, Runjia Zhang +3
Existing methods for evaluating the harmfulness of content generated by large language models (LLMs) have been well studied. However, approaches tailored to multimodal large langua…