3 papers
cs.CR2026
MANATEE: Inference-Time Lightweight Diffusion Based Safety Defense for LLMs
Chun Yan Ryan Kan, Tommy Tran, Vedant Yadav +4
Defending LLMs against adversarial jailbreak attacks remains an open challenge. Existing defenses rely on binary classifiers that fail when adversarial input falls outside the lear…
cs.AI2026
ProMoral-Bench: Evaluating Prompting Strategies for Moral Reasoning and Safety in LLMs
Rohan Subramanian Thomas, Shikhar Shiromani, Abdullah Chaudhry +4
Prompt design significantly impacts the moral competence and safety alignment of large language models (LLMs), yet empirical comparisons remain fragmented across datasets and model…
cs.CL2025
DLP-LoRA: Efficient Task-Specific LoRA Fusion with a Dynamic, Lightweight Plugin for Large Language Models
Yuxuan Zhang, Ruizhe Li
Recent advancements in Large Language Models (LLMs) have achieved robust performance across diverse tasks, but fine-tuning these models for specific domains remains resource-intens…