1 citations · 1 across the 3 of their papers we have counts for
5 papers
DualPrompt-MedCap: A Dual-Prompt Enhanced Approach for Medical Image Captioning
Yining Zhao, Ali Braytee, Mukesh Prasad
Medical image captioning via vision-language models has shown promising potential for clinical diagnosis assistance. However, generating contextually relevant descriptions with acc…
AeroLite: Tag-Guided Lightweight Generation of Aerial Image Captions
Xing Zi, Tengjun Ni, Xianjing Fan +4
Accurate and automated captioning of aerial imagery is crucial for applications like environmental monitoring, urban planning, and disaster management. However, this task remains c…
Vision Transformers with Autoencoders and Explainable AI for Cancer Patient Risk Stratification Using Whole Slide Imaging
Ahmad Hussein, Mukesh Prasad, Ali Anaissi +1
Cancer remains one of the leading causes of mortality worldwide, necessitating accurate diagnosis and prognosis. Whole Slide Imaging (WSI) has become an integral part of clinical w…
Enhancing Sentiment Analysis through Multimodal Fusion: A BERT-DINOv2 Approach
Taoxu Zhao, Meisi Li, Kehao Chen +6
Multimodal sentiment analysis enhances conventional sentiment analysis, which traditionally relies solely on text, by incorporating information from different modalities such as im…
Visual and Text Prompt Segmentation: A Novel Multi-Model Framework for Remote Sensing
Xing Zi, Kairui Jin, Xian Tao +4
Pixel-level segmentation is essential in remote sensing, where foundational vision models like CLIP and Segment Anything Model(SAM) have demonstrated significant capabilities in ze…