3 papers
cs.LG2026
Steered Generation via Gradient-Based Optimization on Sparse Query Features
Sumanta Bhattacharyya, Pedram Rooshenas
Latent steering exploits internal representations of Large Language Models (LLMs) to guide generation, yet interventions on dense states can entangle distinct semantic features. In…
cs.LG2026
TARO: Temporal Adversarial Rectification Optimization Using Diffusion Models as Purifiers
Daniel Wesego, Pedram Rooshenas
Adversarial purification with diffusion models seeks to project adversarial examples back toward the data manifold, but balancing semantic preservation and robustness against adapt…
cs.CL2025
Audited Reasoning Refinement: Fine-Tuning Language Models via LLM-Guided Step-Wise Evaluation and Correction
Sumanta Bhattacharyya, Sara Riazi, Pedram Rooshenas
Training a task-specific small reasoning model is challenging when direct human supervision or high-quality labels are scarce. However, LLMs with reasoning capabilities produce abu…