3 papers
cs.CV2026
What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks
Guanhua Ye, Niu Jingbin, Yan Li +4
Short-answer VQA benchmarks conflate two distinct quantities: whether a model's answer is semantically correct, and whether that answer matches the surface form expected by the aut…
eess.IV2026
Beyond Metadata: CAPRA for Hidden Subgroup Analysis under Missing Metadata in Medical Imaging
Yawen Li, Yan Li, Zhe Xue +3
Medical imaging models are often deployed without the demographic, acquisition, and quality metadata needed for subgroup auditing. Once those metadata disappear, clinically critica…
cs.LG2026
Sharper Generalization Bounds for Transformer
Yawen Li, Tao Hu, Zhouhui Lian +4
This paper studies generalization error bounds for Transformer models. Based on the offset Rademacher complexity, we derive sharper generalization bounds for different Transformer…