5 papers · 1 filter
Vector-Quantized Vision Foundation Models for Object-Centric Learning
Rongzhen Zhao, Vivienne Wang, Juho Kannala +1
Object-Centric Learning (OCL) aggregates image or video feature maps into object-level feature vectors, termed \textit{slots}. It's self-supervision of reconstructing the input fro…
Grouped Discrete Representation for Object-Centric Learning
Rongzhen Zhao, Vivienne Wang, Juho Kannala +1
Object-Centric Learning (OCL) aims to discover objects in images or videos by reconstructing the input. Representative methods achieve this by reconstructing the input as its Varia…
Multi-Scale Fusion for Object Representation
Rongzhen Zhao, Vivienne Wang, Juho Kannala +1
Representing images or videos as object-level feature vectors, rather than pixel-level feature maps, facilitates advanced visual tasks. Object-Centric Learning (OCL) primarily achi…
Organized Grouped Discrete Representation for Object-Centric Learning
Rongzhen Zhao, Vivienne Wang, Juho Kannala +1
Object-Centric Learning (OCL) represents dense image or video pixels as sparse object features. Representative methods utilize discrete representation composed of Variational Autoe…
Grouped Discrete Representation Guides Object-Centric Learning
Rongzhen Zhao, Vivienne Wang, Juho Kannala +1
Similar to humans perceiving visual scenes as objects, Object-Centric Learning (OCL) can abstract dense images or videos into sparse object-level features. Transformer-based OCL ha…