evaluation metrics 1generalization across domains 1ideological bias 1language model finetuning 1model alignment 1
From the 1 of 6 linked papers with an AI index.
Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
ContextBench: Modifying Contexts for Targeted Latent Activation
Robert Graham, Edward Stevinson, Leo Richter +3
Identifying inputs that trigger specific behaviours or latent features in language models could have a wide range of safety use cases. We investigate a class of methods capable of…
cs.AI2025
A Scalable Approach to Probabilistic Neuro-Symbolic Robustness Verification
Vasileios Manginas, Nikolaos Manginas, Edward Stevinson +4
Neuro-Symbolic Artificial Intelligence (NeSy AI) has emerged as a promising direction for integrating neural learning with symbolic reasoning. Typically, in the probabilistic varia…