4 papers
Contrastive Conceptor Activation Steering (COAST): Unlocking Vision-Language-Action Models through Hidden States
Miranda Muqing Miao, Subin Kim, Brandon Yang +1
Vision-Language-Action (VLA) models leverage powerful perceptual priors from web-scale Vision-Language Model (VLM) pre-training, yet they remain surprisingly brittle in practice, f…
Rethinking Prompt Design for Inference-time Scaling in Text-to-Visual Generation
Subin Kim, Sangwoo Mo, Mamshad Nayeem Rizve +4
Achieving precise alignment between user intent and generated visuals remains a central challenge in text-to-visual generation, as a single attempt often fails to produce the desir…
FontAdapter: Instant Font Adaptation in Visual Text Generation
Myungkyu Koo, Subin Kim, Sangkyung Kwak +3
Text-to-image diffusion models have significantly improved the seamless integration of visual text into diverse image contexts. Recent approaches further improve control over font…
Tuning-Free Multi-Event Long Video Generation via Synchronized Coupled Sampling
Subin Kim, Seoung Wug Oh, Jui-Hsien Wang +2
While recent advancements in text-to-video diffusion models enable high-quality short video generation from a single prompt, generating real-world long videos in a single pass rema…