NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (69)

cs.LG2026

Reliable and Responsible Foundation Models: A Comprehensive Survey

Xinyu Yang, Junlin Han, Rishi Bommasani +49

cs.LG2024

When Do Prompting and Prefix-Tuning Work? A Theory of Capabilities and Limitations

Aleksandar Petrov, Philip H. S. Torr, Adel Bibi

cs.LG2020

Network Moments: Extensions and Sparse-Smooth Attacks

Modar Alfadly, Adel Bibi, Emilio Botero +2

cs.LG2025

Tahakom LLM Guidelines and Recipes: From Pre-training Data to an Arabic LLM

Areej AlOtaibi, Lina Alyahya, Raghad Alshabanah +12

math.OC2020

Improving SAGA via a Probabilistic Interpolation with Gradient Descent

Adel Bibi, Alibek Sailanbayev, Bernard Ghanem +2

cs.LG2025

Detecting LLM Hallucination Through Layer-wise Information Deficiency: Analysis of Ambiguous Prompts and Unanswerable Questions

Hazel Kim, Tom A. Lamb, Adel Bibi +2

cs.LG2024

From Categories to Classifiers: Name-Only Continual Learning by Exploring the Web

Ameya Prabhu, Hasan Abed Al Kader Hammoud, Ser-Nam Lim +3

cs.LG2026

Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments

Mykola Vysotskyi, Runqi Lin, Grzegorz Biziel +22

cs.CL2024

Model Merging and Safety Alignment: One Bad Model Spoils the Bunch

Hasan Abed Al Kader Hammoud, Umberto Michieli, Fabio Pizzati +4

cs.LG2024

Efficient Error Certification for Physics-Informed Neural Networks

Francisco Eiras, Adel Bibi, Rudy Bunel +3

cs.LG2026

FORCE: Transferable Visual Jailbreaking Attacks via Feature Over-Reliance CorrEction

Runqi Lin, Alasdair Paren, Suqin Yuan +4

cs.LG2024

Continual Learning on a Diet: Learning from Sparsely Labeled Streams Under Constrained Computation

Wenxuan Zhang, Youssef Mohamed, Bernard Ghanem +3

cs.CR2025

ToolTweak: An Attack on Tool Selection in LLM-based Agents

Jonathan Sneh, Ruomei Yan, Jialin Yu +6

cs.LG2026

Safer by Diffusion, Broken by Context: Diffusion LLM's Safety Blessing and Its Failure Mode

Zeyuan He, Yupeng Chen, Lang Lin +7

cs.CV2025

On the Coexistence and Ensembling of Watermarks

Aleksandar Petrov, Shruti Agarwal, Philip H. S. Torr +2

cs.AI2026

$D^2$-Monitor: Dynamic Safety Monitoring for Diffusion LLMs via Hesitation-Aware Routing

Aoxi Liu, Yupeng Chen, James Oldfield +5

cs.CR2026

MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents

Lukas Aichberger, Alasdair Paren, Guohao Li +3

cs.LG2025

Towards Certification of Uncertainty Calibration under Adversarial Attacks

Cornelius Emde, Francesco Pinto, Thomas Lukasiewicz +2

cs.CV2024

Segment, Select, Correct: A Framework for Weakly-Supervised Referring Segmentation

Francisco Eiras, Kemal Oksuz, Adel Bibi +2

cs.LG2021

Expected Tight Bounds for Robust Training

Salman Alsubaihi, Adel Bibi, Modar Alfadly +2

cs.LG2023

Certifying Ensembles: A General Certification Theory with S-Lipschitzness

Aleksandar Petrov, Francisco Eiras, Amartya Sanyal +2

cs.AI2026

BiasBusters: Uncovering and Mitigating Tool Selection Bias in Large Language Models

Thierry Blankenstein, Jialin Yu, Zixuan Li +6

cs.CV2018

TrackingNet: A Large-Scale Dataset and Benchmark for Object Tracking in the Wild

Matthias Müller, Adel Bibi, Silvio Giancola +2

math.OC2020

A Stochastic Derivative Free Optimization Method with Momentum

Eduard Gorbunov, Adel Bibi, Ozan Sener +2

cs.CL2025

Do as I do (Safely): Mitigating Task-Specific Fine-tuning Risks in Large Language Models

Francisco Eiras, Aleksandar Petrov, Philip H. S. Torr +2

cs.LG2024

Efficient Lifelong Model Evaluation in an Era of Rapid Progress

Ameya Prabhu, Vishaal Udandarao, Philip Torr +3

cs.LG2021

DeformRS: Certifying Input Deformations with Randomized Smoothing

Motasem Alfarra, Adel Bibi, Naeemullah Khan +2

cs.LG2024

Label Delay in Online Continual Learning

Botos Csaba, Wenxuan Zhang, Matthias Müller +4

cs.CR2026

The Authorization-Execution Gap Is a Major Safety and Security Problem in Open-World Agents

Baoyuan Wu, Qingshan Liu, Adel Bibi +2

cs.LG2022

On the Decision Boundaries of Neural Networks: A Tropical Geometry Perspective

Motasem Alfarra, Adel Bibi, Hasan Hammoud +2

cs.CV2024

On Pretraining Data Diversity for Self-Supervised Learning

Hasan Abed Al Kader Hammoud, Tuhin Das, Fabio Pizzati +3

cs.CV2022

Diversified Dynamic Routing for Vision Tasks

Botos Csaba, Adel Bibi, Yanwei Li +2

cs.LG2024

Near to Mid-term Risks and Opportunities of Open-Source Generative AI

Francisco Eiras, Aleksandar Petrov, Bertie Vidgen +21

cs.LG2026

Beyond Linear Probes: Dynamic Safety Monitoring for Language Models

James Oldfield, Philip Torr, Ioannis Patras +2

cs.LG2023

Constrained Clustering: General Pairwise and Cardinality Constraints

Adel Bibi, Ali Alqahtani, Bernard Ghanem

cs.LG2025

Mixture of Experts Made Intrinsically Interpretable

Xingyi Yang, Constantin Venhoff, Ashkan Khakzar +4

math.OC2020

A Stochastic Derivative-Free Optimization Method with Importance Sampling: Theory and Learning to Control

Adel Bibi, El Houcine Bergou, Ozan Sener +2

cs.CL2023

Language Model Tokenizers Introduce Unfairness Between Languages

Aleksandar Petrov, Emanuele La Malfa, Philip H. S. Torr +1

cs.LG2022

Make Some Noise: Reliable and Efficient Single-Step Adversarial Training

Pau de Jorge, Adel Bibi, Riccardo Volpi +4

cs.LG2021

Combating Adversaries with Anti-Adversaries

Motasem Alfarra, Juan C. Pérez, Ali Thabet +3

cs.LG2023

Catastrophic overfitting can be induced with discriminative non-robust features

Guillermo Ortiz-Jiménez, Pau de Jorge, Amartya Sanyal +5

cs.LG2023

Rapid Adaptation in Online Continual Learning: Are We Evaluating It Right?

Hasan Abed Al Kader Hammoud, Ameya Prabhu, Ser-Nam Lim +3

cs.LG2021

Rethinking Clustering for Robustness

Motasem Alfarra, Juan C. Pérez, Adel Bibi +3

cs.CR2023

Don't FREAK Out: A Frequency-Inspired Approach to Detecting Backdoor Poisoned Samples in DNNs

Hasan Abed Al Kader Hammoud, Adel Bibi, Philip H. S. Torr +1

cs.CL2025

Measuring what Matters: Construct Validity in Large Language Model Benchmarks

Andrew M. Bean, Ryan Othniel Kearns, Angelika Romanou +39

cs.LG2025

Open Problems in Machine Unlearning for AI Safety

Fazl Barez, Tingchen Fu, Ameya Prabhu +16

cs.CL2025

Shh, don't say that! Domain Certification in LLMs

Cornelius Emde, Alasdair Paren, Preetham Arvind +6

cs.LG2024

Towards Interpretable Deep Local Learning with Successive Gradient Reconciliation

Yibo Yang, Xiaojie Li, Motasem Alfarra +4

cs.CV2020

Gabor Layers Enhance Network Robustness

Juan C. Pérez, Motasem Alfarra, Guillaume Jeanneret +4

cs.LG2026

The Alignment Curse: Modality Alignment Supercharges Audio Attacks via Text Transfer

Yupeng Chen, Junchi Yu, Aoxi Liu +3

cs.LG2024

Prompting a Pretrained Transformer Can Be a Universal Approximator

Aleksandar Petrov, Philip H. S. Torr, Adel Bibi

cs.CV2024

SynthCLIP: Are We Ready for a Fully Synthetic CLIP Training?

Hasan Abed Al Kader Hammoud, Hani Itani, Fabio Pizzati +3

cs.CV2019

Analytical Moment Regularizer for Gaussian Robust Networks

Modar Alfadly, Adel Bibi, Bernard Ghanem

cs.LG2022

Data-Dependent Randomized Smoothing

Motasem Alfarra, Adel Bibi, Philip H. S. Torr +1

cs.LG2023

Computationally Budgeted Continual Learning: What Does Matter?

Ameya Prabhu, Hasan Abed Al Kader Hammoud, Puneet Dokania +4

cs.LG2022

ANCER: Anisotropic Certification via Sample-wise Volume Maximization

Francisco Eiras, Motasem Alfarra, M. Pawan Kumar +4

cs.LG2024

Risks and Opportunities of Open-Source Generative AI

Francisco Eiras, Aleksandar Petrov, Bertie Vidgen +22

cs.LG2024

Universal In-Context Approximation By Prompting Fully Recurrent Models

Aleksandar Petrov, Tom A. Lamb, Alasdair Paren +2

cs.CL2025

Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning

Lama Alssum, Hani Itani, Hasan Abed Al Kader Hammoud +3

cs.HC2026

It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents

Karolina Korgul, Yushi Yang, Arkadiusz Drohomirecki +7

cs.AI2024

Illusory Attacks: Information-Theoretic Detectability Matters in Adversarial Attacks

Tim Franzmeyer, Stephen McAleer, João F. Henriques +4

cs.AI2025

Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models

Wenxuan Zhang, Philip H. S. Torr, Mohamed Elhoseiny +1

cs.AI2024

Can Large Language Model Agents Simulate Human Trust Behavior?

Chengxing Xie, Canyu Chen, Feiran Jia +11

eess.IV2024

FedMedICL: Towards Holistic Evaluation of Distribution Shifts in Federated Medical Imaging

Kumail Alhamoud, Yasir Ghunaim, Motasem Alfarra +5

cs.CV2024

SimCS: Simulation for Domain Incremental Online Continual Segmentation

Motasem Alfarra, Zhipeng Cai, Adel Bibi +2

cs.LG2025

Rethinking Safety in LLM Fine-tuning: An Optimization Perspective

Minseon Kim, Jin Myung Kwak, Lama Alssum +5

cs.AI2026

OMNI-LEAK: Orchestrator Multi-Agent Network Induced Data Leakage

Akshat Naik, Jay Culligan, Yarin Gal +4

cs.CV2024

No "Zero-Shot" Without Exponential Data: Pretraining Concept Frequency Determines Multimodal Model Performance

Vishaal Udandarao, Ameya Prabhu, Adhiraj Ghosh +5

cs.LG2023

Real-Time Evaluation in Online Continual Learning: A New Hope

Yasir Ghunaim, Adel Bibi, Kumail Alhamoud +5