Publications (69)
Reliable and Responsible Foundation Models: A Comprehensive Survey
Xinyu Yang, Junlin Han, Rishi Bommasani +49
When Do Prompting and Prefix-Tuning Work? A Theory of Capabilities and Limitations
Aleksandar Petrov, Philip H. S. Torr, Adel Bibi
Network Moments: Extensions and Sparse-Smooth Attacks
Modar Alfadly, Adel Bibi, Emilio Botero +2
Tahakom LLM Guidelines and Recipes: From Pre-training Data to an Arabic LLM
Areej AlOtaibi, Lina Alyahya, Raghad Alshabanah +12
Improving SAGA via a Probabilistic Interpolation with Gradient Descent
Adel Bibi, Alibek Sailanbayev, Bernard Ghanem +2
Detecting LLM Hallucination Through Layer-wise Information Deficiency: Analysis of Ambiguous Prompts and Unanswerable Questions
Hazel Kim, Tom A. Lamb, Adel Bibi +2
From Categories to Classifiers: Name-Only Continual Learning by Exploring the Web
Ameya Prabhu, Hasan Abed Al Kader Hammoud, Ser-Nam Lim +3
Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments
Mykola Vysotskyi, Runqi Lin, Grzegorz Biziel +22
Model Merging and Safety Alignment: One Bad Model Spoils the Bunch
Hasan Abed Al Kader Hammoud, Umberto Michieli, Fabio Pizzati +4
Efficient Error Certification for Physics-Informed Neural Networks
Francisco Eiras, Adel Bibi, Rudy Bunel +3
FORCE: Transferable Visual Jailbreaking Attacks via Feature Over-Reliance CorrEction
Runqi Lin, Alasdair Paren, Suqin Yuan +4
Continual Learning on a Diet: Learning from Sparsely Labeled Streams Under Constrained Computation
Wenxuan Zhang, Youssef Mohamed, Bernard Ghanem +3
ToolTweak: An Attack on Tool Selection in LLM-based Agents
Jonathan Sneh, Ruomei Yan, Jialin Yu +6
Safer by Diffusion, Broken by Context: Diffusion LLM's Safety Blessing and Its Failure Mode
Zeyuan He, Yupeng Chen, Lang Lin +7
On the Coexistence and Ensembling of Watermarks
Aleksandar Petrov, Shruti Agarwal, Philip H. S. Torr +2
$D^2$-Monitor: Dynamic Safety Monitoring for Diffusion LLMs via Hesitation-Aware Routing
Aoxi Liu, Yupeng Chen, James Oldfield +5
MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents
Lukas Aichberger, Alasdair Paren, Guohao Li +3
Towards Certification of Uncertainty Calibration under Adversarial Attacks
Cornelius Emde, Francesco Pinto, Thomas Lukasiewicz +2
Segment, Select, Correct: A Framework for Weakly-Supervised Referring Segmentation
Francisco Eiras, Kemal Oksuz, Adel Bibi +2
Expected Tight Bounds for Robust Training
Salman Alsubaihi, Adel Bibi, Modar Alfadly +2
Certifying Ensembles: A General Certification Theory with S-Lipschitzness
Aleksandar Petrov, Francisco Eiras, Amartya Sanyal +2
BiasBusters: Uncovering and Mitigating Tool Selection Bias in Large Language Models
Thierry Blankenstein, Jialin Yu, Zixuan Li +6
TrackingNet: A Large-Scale Dataset and Benchmark for Object Tracking in the Wild
Matthias Müller, Adel Bibi, Silvio Giancola +2
A Stochastic Derivative Free Optimization Method with Momentum
Eduard Gorbunov, Adel Bibi, Ozan Sener +2
Do as I do (Safely): Mitigating Task-Specific Fine-tuning Risks in Large Language Models
Francisco Eiras, Aleksandar Petrov, Philip H. S. Torr +2
Efficient Lifelong Model Evaluation in an Era of Rapid Progress
Ameya Prabhu, Vishaal Udandarao, Philip Torr +3
DeformRS: Certifying Input Deformations with Randomized Smoothing
Motasem Alfarra, Adel Bibi, Naeemullah Khan +2
Label Delay in Online Continual Learning
Botos Csaba, Wenxuan Zhang, Matthias Müller +4
The Authorization-Execution Gap Is a Major Safety and Security Problem in Open-World Agents
Baoyuan Wu, Qingshan Liu, Adel Bibi +2
On the Decision Boundaries of Neural Networks: A Tropical Geometry Perspective
Motasem Alfarra, Adel Bibi, Hasan Hammoud +2
On Pretraining Data Diversity for Self-Supervised Learning
Hasan Abed Al Kader Hammoud, Tuhin Das, Fabio Pizzati +3
Diversified Dynamic Routing for Vision Tasks
Botos Csaba, Adel Bibi, Yanwei Li +2
Near to Mid-term Risks and Opportunities of Open-Source Generative AI
Francisco Eiras, Aleksandar Petrov, Bertie Vidgen +21
Beyond Linear Probes: Dynamic Safety Monitoring for Language Models
James Oldfield, Philip Torr, Ioannis Patras +2
Constrained Clustering: General Pairwise and Cardinality Constraints
Adel Bibi, Ali Alqahtani, Bernard Ghanem
Mixture of Experts Made Intrinsically Interpretable
Xingyi Yang, Constantin Venhoff, Ashkan Khakzar +4
A Stochastic Derivative-Free Optimization Method with Importance Sampling: Theory and Learning to Control
Adel Bibi, El Houcine Bergou, Ozan Sener +2
Language Model Tokenizers Introduce Unfairness Between Languages
Aleksandar Petrov, Emanuele La Malfa, Philip H. S. Torr +1
Make Some Noise: Reliable and Efficient Single-Step Adversarial Training
Pau de Jorge, Adel Bibi, Riccardo Volpi +4
Combating Adversaries with Anti-Adversaries
Motasem Alfarra, Juan C. Pérez, Ali Thabet +3
Catastrophic overfitting can be induced with discriminative non-robust features
Guillermo Ortiz-Jiménez, Pau de Jorge, Amartya Sanyal +5
Rapid Adaptation in Online Continual Learning: Are We Evaluating It Right?
Hasan Abed Al Kader Hammoud, Ameya Prabhu, Ser-Nam Lim +3
Rethinking Clustering for Robustness
Motasem Alfarra, Juan C. Pérez, Adel Bibi +3
Don't FREAK Out: A Frequency-Inspired Approach to Detecting Backdoor Poisoned Samples in DNNs
Hasan Abed Al Kader Hammoud, Adel Bibi, Philip H. S. Torr +1
Measuring what Matters: Construct Validity in Large Language Model Benchmarks
Andrew M. Bean, Ryan Othniel Kearns, Angelika Romanou +39
Open Problems in Machine Unlearning for AI Safety
Fazl Barez, Tingchen Fu, Ameya Prabhu +16
Shh, don't say that! Domain Certification in LLMs
Cornelius Emde, Alasdair Paren, Preetham Arvind +6
Towards Interpretable Deep Local Learning with Successive Gradient Reconciliation
Yibo Yang, Xiaojie Li, Motasem Alfarra +4
Gabor Layers Enhance Network Robustness
Juan C. Pérez, Motasem Alfarra, Guillaume Jeanneret +4
The Alignment Curse: Modality Alignment Supercharges Audio Attacks via Text Transfer
Yupeng Chen, Junchi Yu, Aoxi Liu +3
Prompting a Pretrained Transformer Can Be a Universal Approximator
Aleksandar Petrov, Philip H. S. Torr, Adel Bibi
SynthCLIP: Are We Ready for a Fully Synthetic CLIP Training?
Hasan Abed Al Kader Hammoud, Hani Itani, Fabio Pizzati +3
Analytical Moment Regularizer for Gaussian Robust Networks
Modar Alfadly, Adel Bibi, Bernard Ghanem
Data-Dependent Randomized Smoothing
Motasem Alfarra, Adel Bibi, Philip H. S. Torr +1
Computationally Budgeted Continual Learning: What Does Matter?
Ameya Prabhu, Hasan Abed Al Kader Hammoud, Puneet Dokania +4
ANCER: Anisotropic Certification via Sample-wise Volume Maximization
Francisco Eiras, Motasem Alfarra, M. Pawan Kumar +4
Risks and Opportunities of Open-Source Generative AI
Francisco Eiras, Aleksandar Petrov, Bertie Vidgen +22
Universal In-Context Approximation By Prompting Fully Recurrent Models
Aleksandar Petrov, Tom A. Lamb, Alasdair Paren +2
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
Lama Alssum, Hani Itani, Hasan Abed Al Kader Hammoud +3
It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents
Karolina Korgul, Yushi Yang, Arkadiusz Drohomirecki +7
Illusory Attacks: Information-Theoretic Detectability Matters in Adversarial Attacks
Tim Franzmeyer, Stephen McAleer, João F. Henriques +4
Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models
Wenxuan Zhang, Philip H. S. Torr, Mohamed Elhoseiny +1
Can Large Language Model Agents Simulate Human Trust Behavior?
Chengxing Xie, Canyu Chen, Feiran Jia +11
FedMedICL: Towards Holistic Evaluation of Distribution Shifts in Federated Medical Imaging
Kumail Alhamoud, Yasir Ghunaim, Motasem Alfarra +5
SimCS: Simulation for Domain Incremental Online Continual Segmentation
Motasem Alfarra, Zhipeng Cai, Adel Bibi +2
Rethinking Safety in LLM Fine-tuning: An Optimization Perspective
Minseon Kim, Jin Myung Kwak, Lama Alssum +5
OMNI-LEAK: Orchestrator Multi-Agent Network Induced Data Leakage
Akshat Naik, Jay Culligan, Yarin Gal +4
No "Zero-Shot" Without Exponential Data: Pretraining Concept Frequency Determines Multimodal Model Performance
Vishaal Udandarao, Ameya Prabhu, Adhiraj Ghosh +5
Real-Time Evaluation in Online Continual Learning: A New Hope
Yasir Ghunaim, Adel Bibi, Kumail Alhamoud +5