2 papers
cs.RO2025
mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs
Jonas Pai, Liam Achenbach, Victoriano Montesinos +3
Prevailing Vision-Language-Action Models (VLAs) for robotic manipulation are built upon vision-language backbones pretrained on large-scale, but disconnected static web data. As a…
cs.RO2025
mimic-one: a Scalable Model Recipe for General Purpose Robot Dexterity
Elvis Nava, Victoriano Montesinos, Erik Bauer +8
We present a diffusion-based model recipe for real-world control of a highly dexterous humanoid robotic hand, designed for sample-efficient learning and smooth fine-motor action in…