1 paper
Seongro Yoon, Donghyeon Cho, Jinsun Park +1
Understanding facial expressions in videos requires modeling subtle and localized facial dynamics under unconstrained conditions. Although recent Vision Transformer (ViT)-based vid…