6 papers
Visual Access Boundaries in Vision-Language Model Reasoning
Hiroto Osaka, Shohei Taniguchi, Gouki Minegishi +3
Chain-of-Thought (CoT) prompting is widely used as a test-time scaling strategy for Vision-Language Models (VLMs), but it remains unclear what is extended when VLMs generate longer…
SUNTA: Hierarchical Video Prediction with Surprise-based Chunking
Tomoshi Iiyama, Masahiro Suzuki, Yutaka Matsuo
Hierarchical state-space models (HSSMs) offer a promising approach to long-horizon prediction by segmenting sequences into temporal chunks. However, their performance hinges on how…
When Object-Centric World Models Meet Policy Learning: From Pixels to Policies, and Where It Breaks
Stefano Ferraro, Akihiro Nakano, Masahiro Suzuki +1
Object-centric world models (OCWM) aim to decompose visual scenes into object-level representations, providing structured abstractions that could improve compositional generalizati…
ADOPT: Modified Adam Can Converge with Any with the Optimal Rate
Shohei Taniguchi, Keno Harada, Gouki Minegishi +7
Adam is one of the most popular optimization algorithms in deep learning. However, it is known that Adam does not converge in theory unless choosing a hyperparameter, i.e., ,…
Object-Centric Temporal Consistency via Conditional Autoregressive Inductive Biases
Cristian Meo, Akihiro Nakano, Mircea Lică +7
Unsupervised object-centric learning from videos is a promising approach towards learning compositional representations that can be applied to various downstream tasks, such as pre…
Enhancing Unimodal Latent Representations in Multimodal VAEs through Iterative Amortized Inference
Yuta Oshima, Masahiro Suzuki, Yutaka Matsuo
Multimodal variational autoencoders (VAEs) aim to capture shared latent representations by integrating information from different data modalities. A significant challenge is accura…