2 papers
cs.CV2026
Do VLMs Need Vision Transformers? Evaluating State Space Models as Vision Encoders
Shang-Jui Ray Kuo, Paola Cascante-Bonilla
Large vision--language models (VLMs) often use a frozen vision backbone, whose image features are mapped into a large language model through a lightweight connector. While transfor…
cs.CV2024
Improving Limited Supervised Foot Ulcer Segmentation Using Cross-Domain Augmentation
Shang-Jui Kuo, Po-Han Huang, Chia-Ching Lin +2
Diabetic foot ulcers pose health risks, including higher morbidity, mortality, and amputation rates. Monitoring wound areas is crucial for proper care, but manual segmentation is s…