2 papers
cs.CV2024
Multi-Point Positional Insertion Tuning for Small Object Detection
Kanoko Goto, Takumi Karasawa, Takumi Hirose +2
Small object detection aims to localize and classify small objects within images. With recent advances in large-scale vision-language pretraining, finetuning pretrained object dete…
cs.AI2024
AdaCoder: Adaptive Prompt Compression for Programmatic Visual Question Answering
Mahiro Ukai, Shuhei Kurita, Atsushi Hashimoto +2
Visual question answering aims to provide responses to natural language questions given visual input. Recently, visual programmatic models (VPMs), which generate executable program…