Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
Fan Du, Feng Yan, Jianxiong Wu +8
Flow-based vision-language-action (VLA) policies offer strong expressivity for action generation, but suffer from a fundamental inefficiency: multi-step inference is required to re…
cs.CV2025
SPIE: Semantic and Structural Post-Training of Image Editing Diffusion Models with AI feedback
Elior Benarous, Yilun Du, Heng Yang
This paper presents SPIE: a novel approach for semantic and structural post-training of instruction-based image editing diffusion models, addressing key challenges in alignment wit…