4 papers
InstructMoLE: Instruction-Guided Mixture of Low-rank Experts for Multi-Conditional Image Generation
Jinqi Xiao, Qing Yan, Liming Jiang +8
Parameter-Efficient Fine-Tuning of Diffusion Transformers (DiTs) for diverse, multi-conditional tasks often suffers from task interference when using monolithic adapters like LoRA.…
Camera Control for Text-to-Image Generation via Learning Viewpoint Tokens
Xinxuan Lu, Charless Fowlkes, Alexander C. Berg
Current text-to-image models struggle to provide precise camera control using natural language alone. In this work, we present a framework for precise camera control with global sc…
ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing
Hengjia Li, Liming Jiang, Qing Yan +6
Instruction-driven image editing with unified multimodal generative models has advanced rapidly, yet their underlying visual reasoning remains limited, leading to suboptimal perfor…
StoryMem: Multi-shot Long Video Storytelling with Memory
Kaiwen Zhang, Liming Jiang, Angtian Wang +6
Visual storytelling requires generating multi-shot videos with cinematic quality and long-range consistency. Inspired by human memory, we propose StoryMem, a paradigm that reformul…