2 papers
cs.CV2026
Retrieve What's Missing: Coverage-Maximizing Retrieval for Consistent Long Video Generation
Minseok Joo, Dogyun Park, Taehoon Lee +2
Maintaining long-term geometric consistency remains challenging for long-horizon autoregressive video generation. Memory-augmented generative models address this by retrieving hist…
cs.CV2026
Mitigating State Aliasing in Vision-Language-Action Models via Inverse Dynamics Learning
Kyujin Lee, Injae Kim, Jihwan Park +3
Vision-Language-Action (VLA) models have emerged as a promising framework that unifies perception, reasoning, and control for robot manipulation by adapting pretrained vision-langu…