2 papers
cs.GR2025
3D-LATTE: Latent Space 3D Editing from Textual Instructions
Maria Parelli, Michael Oechsle, Michael Niemeyer +2
Despite the recent success of multi-view diffusion models for text/image-based 3D asset generation, instruction-based editing of 3D assets lacks surprisingly far behind the quality…
cs.CV2023
Interpretable Visual Question Answering via Reasoning Supervision
Maria Parelli, Dimitrios Mallis, Markos Diomataris +1
Transformer-based architectures have recently demonstrated remarkable performance in the Visual Question Answering (VQA) task. However, such models are likely to disregard crucial…