1 paper
Shuxin Zhuang, Zi Liang, Runsheng Yu +4
Recent vision-centric approaches have made significant strides in long-context modeling. Represented by DeepSeek-OCR, these models encode rendered text into continuous vision token…