3 papers
cs.CL2026
GradShield: Alignment Preserving Finetuning
Zhanhao Hu, Xiao Huang, Patrick Mendoza +4
Large Language Models (LLMs) pose a significant risk of safety misalignment after finetuning, as models can be compromised by both explicitly and implicitly harmful data. Even some…
cs.LG2025
ONG: Orthogonal Natural Gradient Descent
Yajat Yadav, Patrick Mendoza, Jathin Korrapati
Orthogonal Gradient Descent (OGD) has emerged as a powerful method for continual learning. However, its Euclidean projections do not leverage the underlying information-geometric s…
cs.LG2025
Can Transformers Break Encryption Schemes via In-Context Learning?
Jathin Korrapati, Patrick Mendoza, Aditya Tomar +1
In-context learning (ICL) has emerged as a powerful capability of transformer-based language models, enabling them to perform tasks by conditioning on a small number of examples pr…