activity
20242026
collaborators

6 papers

cs.AI2026

Visual Access Boundaries in Vision-Language Model Reasoning

Hiroto Osaka, Shohei Taniguchi, Gouki Minegishi +3

Chain-of-Thought (CoT) prompting is widely used as a test-time scaling strategy for Vision-Language Models (VLMs), but it remains unclear what is extended when VLMs generate longer…

cs.AI2026

SUNTA: Hierarchical Video Prediction with Surprise-based Chunking

Tomoshi Iiyama, Masahiro Suzuki, Yutaka Matsuo

Hierarchical state-space models (HSSMs) offer a promising approach to long-horizon prediction by segmenting sequences into temporal chunks. However, their performance hinges on how…

cs.AI2025

When Object-Centric World Models Meet Policy Learning: From Pixels to Policies, and Where It Breaks

Stefano Ferraro, Akihiro Nakano, Masahiro Suzuki +1

Object-centric world models (OCWM) aim to decompose visual scenes into object-level representations, providing structured abstractions that could improve compositional generalizati…

cs.LG2024

ADOPT: Modified Adam Can Converge with Any with the Optimal Rate

Shohei Taniguchi, Keno Harada, Gouki Minegishi +7

Adam is one of the most popular optimization algorithms in deep learning. However, it is known that Adam does not converge in theory unless choosing a hyperparameter, i.e., ,…

cs.CV2024

Object-Centric Temporal Consistency via Conditional Autoregressive Inductive Biases

Cristian Meo, Akihiro Nakano, Mircea Lică +7

Unsupervised object-centric learning from videos is a promising approach towards learning compositional representations that can be applied to various downstream tasks, such as pre…

cs.LG2024

Enhancing Unimodal Latent Representations in Multimodal VAEs through Iterative Amortized Inference

Yuta Oshima, Masahiro Suzuki, Yutaka Matsuo

Multimodal variational autoencoders (VAEs) aim to capture shared latent representations by integrating information from different data modalities. A significant challenge is accura…