2 papers
cs.CV2026
Pocket-Dentist: On-Device Dental Image Understanding via Efficient Multimodal Large Language Models
Kai Bian, Xucheng Guo, Bin Chen +4
Evaluations of dental vision-language models remain fragmented across datasets, task definitions and metrics, and often ignore their computational cost. This limits their widesprea…
cs.GR2025
Ev-Layout: A Large-scale Event-based Multi-modal Dataset for Indoor Layout Estimation and Tracking
Xucheng Guo, Yiran Shen, Xiaofang Xiao +2
This paper presents Ev-Layout, a novel large-scale event-based multi-modal dataset designed for indoor layout estimation and tracking. Ev-Layout makes key contributions to the comm…