activity
20182022
most citedDeep Cooking: Predicting Relative Food Ingredient Amounts from Images

16 citations · 28 across the 9 of their papers we have counts for

collaborators

16 papers

cs.CV2022

D2DF2WOD: Learning Object Proposals for Weakly-Supervised Object Detection via Progressive Domain Adaptation

Yuting Wang, Ricardo Guerrero, Vladimir Pavlovic

Weakly-supervised object detection (WSOD) models attempt to leverage image-level annotations in lieu of accurate but costly-to-obtain object localization labels. This oftentimes le…

cs.CV2022

SOS! Self-supervised Learning Over Sets Of Handled Objects In Egocentric Action Recognition

Victor Escorcia, Ricardo Guerrero, Xiatian Zhu +1

Learning an egocentric action recognition model from video data is challenging due to distractors (e.g., irrelevant objects) in the background. Further integrating object informati…

cs.CV2021

Multi-attribute Pizza Generator: Cross-domain Attribute Control with Conditional StyleGAN

Fangda Han, Guoyao Hao, Ricardo Guerrero +1

Multi-attribute conditional image generation is a challenging problem in computervision. We propose Multi-attribute Pizza Generator (MPG), a conditional Generative Neural Network (…

cs.CV2021

CHEF: Cross-modal Hierarchical Embeddings for Food Domain Retrieval

Hai X. Pham, Ricardo Guerrero, Jiatong Li +1

Despite the abundance of multi-modal data, such as image-text pairs, there has been little effort in understanding the individual entities and their different roles in the construc…

cs.CV2020

MPG: A Multi-ingredient Pizza Image Generator with Conditional StyleGANs

Fangda Han, Guoyao Hao, Ricardo Guerrero +1

Multilabel conditional image generation is a challenging problem in computer vision. In this work we propose Multi-ingredient Pizza Generator (MPG), a conditional Generative Neural…

cs.CV2020

Cross-Modal Retrieval and Synthesis (X-MRS): Closing the Modality Gap in Shared Representation Learning

Ricardo Guerrero, Hai Xuan Pham, Vladimir Pavlovic

Computational food analysis (CFA) naturally requires multi-modal evidence of a particular food, e.g., images, recipe text, etc. A key to making CFA possible is multi-modal shared r…