Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
Demonstrating Generalization Failures via Mixtures of Conditional Policies
Jou Barzdukas, Jack Peck, Julian Schulz +3
Post-training of frontier language models is conducted on curated task suites, and inevitably leaves a distribution shift between training and deployment environments. This exposes…
cs.AI2025
Psychometric Personality Shaping Modulates Capabilities and Safety in Language Models
Stephen Fitz, Peter Romero, Steven Basart +2
Large Language Models increasingly mediate high-stakes interactions, intensifying research on their capabilities and safety. While recent work has shown that LLMs exhibit consisten…