2 papers
cs.CY2026
BioBlue: Systematic runaway-optimiser-like LLM failure modes on biologically and economically aligned AI safety benchmarks for LLMs with simplified observation format
Roland Pihlakas, Sruthi Susan Kuriakose
Many AI alignment discussions of "runaway optimisation" focus on RL agents: unbounded utility maximisers that over-optimise a proxy objective (e.g., "paperclip maximiser", specific…
cs.CL2026
Probabilistic Calibration Is a Trainable Capability in Language Models
Davide Baldelli, Sruthi Kuriakose, Maryam Hashemzadeh +2
Language models are increasingly used in settings where outputs must satisfy user-specified randomness constraints, yet their generation probabilities are often poorly calibrated t…