4 papers · 1 filter
Refine and Align: Confidence Calibration through Multi-Agent Interaction in VQA
Ayush Pandey, Jai Bardhan, Ishita Jain +3
In the context of Visual Question Answering (VQA) and Agentic AI, calibration refers to how closely an AI system's confidence in its answers reflects their actual correctness. This…
OrienText: Surface Oriented Textual Image Generation
Shubham Singh Paliwal, Arushi Jain, Monika Sharma +2
Textual content in images is crucial in e-commerce sectors, particularly in marketing campaigns, product imaging, advertising, and the entertainment industry. Current text-to-image…
Multi-Subject Personalization
Arushi Jain, Shubham Paliwal, Monika Sharma +2
Creative story illustration requires a consistent interplay of multiple characters or objects. However, conventional text-to-image models face significant challenges while producin…
CustomText: Customized Textual Image Generation using Diffusion Models
Shubham Paliwal, Arushi Jain, Monika Sharma +2
Textual image generation spans diverse fields like advertising, education, product packaging, social media, information visualization, and branding. Despite recent strides in langu…