1 paper
Zhizhen Zhang, Lei Zhu, Zhen Fang +2
Pre-training vision-language representations on human action videos has emerged as a promising approach to reduce reliance on large-scale expert demonstrations for training embodie…