4 papers
CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning
Yuxin Chen, Hari Srikanth, Nathan Jew +7
While robot foundation models are growing increasingly capable, the strongest models are typically trained on proprietary data and remain closed-source, limiting downstream users'…
TEXEDO : Test Time Scaling for Controller-aware Language-conditioned Humanoid Motion Generation
Jianuo Cao, Yuxin Chen, Yuzhen Song +3
Text-conditioned motion generation is a promising interface for programming humanoid robots, yet current generators are often trained on human motion datasets retargeted to robot m…
Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning
Zhenghao "Mark" Peng, Wenhao Ding, Yurong You +11
Recent reasoning-augmented Vision-Language-Action (VLA) models have improved the interpretability of end-to-end autonomous driving by generating intermediate reasoning traces. Yet…
Not All Errors Are Made Equal: A Regret Metric for Detecting System-level Trajectory Prediction Failures
Kensuke Nakamura, Ran Tian, Andrea Bajcsy
Robot decision-making increasingly relies on data-driven human prediction models when operating around people. While these models are known to mispredict in out-of-distribution int…