2 papers
cs.CV2026
TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
Peng Cai, Zhaofan Zou, Shifa Liu +7
Document parsing aims to transform unstructured documents into structured and machine-readable representations. Recent advances in Vision-Language Models (VLMs) have significantly…
cs.CV2026
CloSeR: Unified Relational Distillation from Closed-Set Teachers for Category Discovery
Yuanpei Liu, Zhenqi He, Jialu Tang +1
Generalized Category Discovery (GCD) is an intriguing open-world problem that has garnered increasing attention: given partially labelled data, the goal is to correctly recognize k…