2 papers
cs.AI2026
Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning
Adhyyan Narang, Artin Tajdini, Claire Zhang +1
Recent work shows that fine-tuning language models on even a small amount of poisoned data can install targeted misbehavior, and ostensibly benign data can transmit hidden preferen…
cs.LG2026
Instance-Adaptive Online Multicalibration
Zhiming Huang, Jamie Morgenstern, Aaron Roth +1
We study online multicalibration beyond the worst-case. We give a single, efficient algorithm which dynamically interpolates between benign and worst-case sequences by adaptively r…