Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
Linear Multi-Timescale Retention as a Memory-Efficient Vision-Language Bridge
Ashfak Yeafi, Mehedi Hasan, Md Khairul Islam
Vision-Language Models (VLMs) face a critical computational bottleneck when processing high-resolution imagery due to the memory complexity of Softmax Multi-Head Attention…
cs.CV2026
SwinTextUNet: Integrating CLIP-Based Text Guidance into Swin Transformer U-Nets for Medical Image Segmentation
Ashfak Yeafi, Parthaw Goswami, Md Khairul Islam +1
Precise medical image segmentation is fundamental for enabling computer aided diagnosis and effective treatment planning. Traditional models that rely solely on visual features oft…