papers

Publications (19)

cs.CV2023

Masked Autoencoding Does Not Help Natural Language Supervision at Scale

Floris Weers, Vaishaal Shankar, Angelos Katharopoulos +2

cs.AI2017

Unknowable Manipulators: Social Network Curator Algorithms

Samuel Albanie, Hillary Shakespeare, Tom Gunter

stat.ML2014

Sampling for Inference in Probabilistic Models with Fast Bayesian Quadrature

Tom Gunter, Michael A. Osborne, Roman Garnett +2

stat.ML2015

Blitzkriging: Kronecker-structured Stochastic Gaussian Processes

Thomas Nickson, Tom Gunter, Chris Lloyd +2

cs.CL2025

Datasets, Documents, and Repetitions: The Practicalities of Unequal Data Quality

Alex Fang, Hadi Pouransari, Matt Jordan +4

cs.CL2025

Language Models Improve When Pretraining Data Matches Target Tasks

David Mizrahi, Anders Boesen Lindbo Larsen, Jesse Allardice +7

cs.DC2026

Parallel Track Transformers: Enabling Fast GPU Inference with Reduced Synchronization

Chong Wang, Nan Du, Tom Gunter +8

cs.LG2025

Apple Intelligence Foundation Language Models: Tech Report 2025

Ethan Li, Anders Boesen Lindbo Larsen, Chen Zhang +395

cs.CV2024

MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training

Brandon McKinzie, Zhe Gan, Jean-Philippe Fauconnier +29

cs.AI2026

Apple Intelligence Foundation Language Models

Tom Gunter, Zirui Wang, Chong Wang +152

cs.CL2024

Large Language Model-guided Document Selection

Xiang Kong, Tom Gunter, Ruoming Pang

cs.LG2024

Revisiting MoE and Dense Speed-Accuracy Comparisons for LLM Training

Xianzhi Du, Tom Gunter, Xiang Kong +5

stat.ML2014

Efficient Bayesian Nonparametric Modelling of Structured Point Processes

Tom Gunter, Chris Lloyd, Michael A. Osborne +1

cs.CL2025

Reusing Pre-Training Data at Test Time is a Compute Multiplier

Alex Fang, Thomas Voice, Ruoming Pang +2

cs.CV2023

STAIR: Learning Sparse Text and Image Representation in Grounded Tokens

Chen Chen, Bowen Zhang, Liangliang Cao +7

cs.LG2026

AXLearn: Modular, Hardware-Agnostic Large Model Training

Mark Lee, Chang Lan, Tom Gunter +34

cs.CV2023

Mobile V-MoEs: Scaling Down Vision Transformers via Sparse Mixture-of-Experts

Erik Daxberger, Floris Weers, Bowen Zhang +7

stat.ML2015

Variational Inference for Gaussian Process Modulated Poisson Processes

Chris Lloyd, Tom Gunter, Michael A. Osborne +1

cs.CL2025

Can External Validation Tools Improve Annotation Quality for LLM-as-a-Judge?

Arduin Findeis, Floris Weers, Guoli Yin +3