4 papers · 1 filter
Open-Set Semi-Supervised Learning for Long-Tailed Medical Datasets
Daniya Najiha A. Kareem, Jean Lahoud, Mustansar Fiaz +2
Many practical medical imaging scenarios include categories that are under-represented but still crucial. The relevance of image recognition models to real-world applications lies…
AgroGPT: Efficient Agricultural Vision-Language Model with Expert Tuning
Muhammad Awais, Ali Husain Salem Abdulla Alharthi, Amandeep Kumar +2
Significant progress has been made in advancing large multimodal conversational models (LMMs), capitalizing on vast repositories of image-text data available online. Despite this p…
Efficient 3D-Aware Facial Image Editing via Attribute-Specific Prompt Learning
Amandeep Kumar, Muhammad Awais, Sanath Narayan +3
Drawing upon StyleGAN's expressivity and disentangled latent space, existing 2D approaches employ textual prompting to edit facial images with different attributes. In contrast, 3D…
Multi-modal Generation via Cross-Modal In-Context Learning
Amandeep Kumar, Muzammal Naseer, Sanath Narayan +3
In this work, we study the problem of generating novel images from complex multimodal prompt sequences. While existing methods achieve promising results for text-to-image generatio…