6 papers
BindEdit: Taming Attention Leakage for Precise Multi-Object Image Editing
Chaewon Park, Soyoon Lee, Naeun Lee +3
Real image editing enables precise manipulation of visual content, yet existing methods often fail in complex multi-object scenarios, causing semantic blending, object duplication,…
Directional Textual Inversion for Personalized Text-to-Image Generation
Kunhee Kim, NaHyeon Park, Kibeom Hong +1
Textual Inversion (TI) is an efficient approach to text-to-image personalization but often fails on complex prompts. We trace these failures to embedding norm inflation: learned to…
Exploiting Domain Properties in Language-Driven Domain Generalization for Semantic Segmentation
Seogkyu Jeon, Kibeom Hong, Hyeran Byun
Recent domain generalized semantic segmentation (DGSS) studies have achieved notable improvements by distilling semantic knowledge from Vision-Language Models (VLMs). However, they…
DiffBlender: Composable and Versatile Multimodal Text-to-Image Diffusion Models
Sungnyun Kim, Junsoo Lee, Kibeom Hong +2
In this study, we aim to enhance the capabilities of diffusion-based text-to-image (T2I) generation models by integrating diverse modalities beyond textual descriptions within a un…
GC-Fed: Gradient Centralized Federated Learning with Partial Client Participation
Jungwon Seo, Ferhat Ozgur Catak, Chunming Rong +2
Federated Learning (FL) enables privacy-preserving multi-source information fusion (MSIF) but is challenged by client drift in highly heterogeneous data settings. Many existing dri…
ConTEXTure: Consistent Multiview Images to Texture
Jaehoon Ahn, Sumin Cho, Harim Jung +3
We introduce ConTEXTure, a generative network designed to create a texture map/atlas for a given 3D mesh using images from multiple viewpoints. The process begins with generating a…