activity
20242026
most citedXDR-LVLM: An Explainable Vision-Language Large Model for Diabetic Retinopathy Diagnosis

1 citations · 1 across the 4 of their papers we have counts for

collaborators

5 papers

cs.LG2026

Contextual Discrepancy-Aware Contrastive Learning for Robust Medical Time Series Diagnosis in Small-Sample Scenarios

Kaito Tanaka, Aya Nakayama, Masato Ito +2

Medical time series data, such as EEG and ECG, are vital for diagnosing neurological and cardiovascular diseases. However, their precise interpretation faces significant challenges…

cs.CV2025

Semantic-Preserving Cross-Style Visual Reasoning for Robust Multi-Modal Understanding in Large Vision-Language Models

Aya Nakayama, Brian Wong, Yuji Nishimura +1

The "style trap" poses a significant challenge for Large Vision-Language Models (LVLMs), hindering robust semantic understanding across diverse visual styles, especially in in-cont…

cs.CV20251 cited

XDR-LVLM: An Explainable Vision-Language Large Model for Diabetic Retinopathy Diagnosis

Masato Ito, Kaito Tanaka, Keisuke Matsuda +1

Diabetic Retinopathy (DR) is a major cause of global blindness, necessitating early and accurate diagnosis. While deep learning models have shown promise in DR detection, their bla…

cs.CL2025

High-Fidelity Pseudo-label Generation by Large Language Models for Training Robust Radiology Report Classifiers

Brian Wong, Kaito Tanaka

Automated labeling of chest X-ray reports is essential for enabling downstream tasks such as training image-based diagnostic models, population health studies, and clinical decisio…

cs.CV2024

Optimizing Vision-Language Interactions Through Decoder-Only Models

Kaito Tanaka, Benjamin Tan, Brian Wong

Vision-Language Models (VLMs) have emerged as key enablers for multimodal tasks, but their reliance on separate visual encoders introduces challenges in efficiency, scalability, an…