1 paper
Yi Tang Soon, Jun-Wei Hsieh
Foundation models such as CLIP have enabled open-vocabulary object detectors that generalise to novel categories via vision-language similarity. However, the confidence scores thes…