2 papers
cs.CR2026
Conflict-Aware Retriever Editing for Knowledge Injection Attacks on LLM-Based RAG Systems
Xinru Liu, Xianglong Zhang, Di Cai +3
Injecting malicious knowledge into retrieval-augmented generation (RAG) systems can manipulate retrieved evidence and mislead downstream generation, posing a serious security threa…
cs.CL2026
Targeting Misalignment: A Conflict-Aware Framework for Reward-Model-based LLM Alignment
Zixuan Liu, Siavash H. Khajavi, Guangkai Jiang +1
Reward-model-based fine-tuning is a central paradigm in aligning Large Language Models with human preferences. However, such approaches critically rely on the assumption that proxy…