1 paper
Vaishnavi B Mohan, Vijayakrishna Naganoor, Yashas Annadani +1
Vision transformers (ViTs) have become the de facto standard for image encoding across many perception tasks. Despite their empirical success, it remains mechanistically unclear ho…