collaborators

5 papers

cs.LG2025

Adapting Vision-Language Models for Evaluating World Models

Mariya Hendriksen, Tabish Rashid, David Bignell +5

World models - generative models that simulate environment dynamics conditioned on past observations and actions - are gaining prominence in planning, simulation, and embodied AI.…

cs.CV2025

A Practical Investigation of Spatially-Controlled Image Generation with Transformers

Guoxuan Xia, Harleen Hanspal, Petru-Daniel Tudosiu +2

Enabling image generation models to be spatially controlled is an important area of research, empowering users to better generate images according to their own fine-grained specifi…

cs.CL2025

Exploiting Mixture-of-Experts Redundancy Unlocks Multimodal Generative Abilities

Raman Dutt, Harleen Hanspal, Guoxuan Xia +5

In this work, we undertake the challenge of augmenting the existing generative capabilities of pre-trained text-only large language models (LLMs) with multi-modal generation capabi…

cs.CV2024

Generating Compositional Scenes via Text-to-image RGBA Instance Generation

Alessandro Fontanella, Petru-Daniel Tudosiu, Yongxin Yang +2

Text-to-image diffusion generative models can generate high quality images at the cost of tedious prompt engineering. Controllability can be improved by introducing layout conditio…

cs.CV2024

Improving Object Detection via Local-global Contrastive Learning

Danai Triantafyllidou, Sarah Parisot, Ales Leonardis +1

Visual domain gaps often impact object detection performance. Image-to-image translation can mitigate this effect, where contrastive approaches enable learning of the image-to-imag…