Details

A method for object detection by text prompting
ID Rot, Žiga (Author), ID Kristan, Matej (Mentor) More about this mentor... This link opens in a new window, ID Pelhan, Jer (Comentor)

.pdfPDF - Presentation file, Download (6,03 MB)
MD5: 9C8534907F8695B5AF0C92A891B8D993

Abstract
The increasing diversity and scale of object detection datasets have highlighted the limitations of closed-set detectors with fixed vocabularies. Open-set object detection addresses this by enabling the detection of arbitrary classes via text prompts. Grounding DINO is a prominent zero-shot detector, but its training code is not fully open-source, and its implementation is outdated. In this work, we reimplement Grounding DINO, achieving ~20% speedup, and extend it for text-based object counting, though these modifications do not consistently improve FSCD-147 performance. To enable training from scratch, we optimize the model further, achieving an additional ~30% speedup, and develop an edge-oriented variant inspired by a closed-source model. Training on 1.3 million images from scratch, we evaluate the model on COCO and LVIS datasets, where it performs comparably to other open-source models, but remains below the closed-source baseline, likely due to a much smaller training set.

Language:English
Keywords:object detection, computer vision, deep learning
Work type:Master's thesis/paper
Typology:2.09 - Master's Thesis
Organization:FRI - Faculty of Computer and Information Science
Year:2025
PID:20.500.12556/RUL-175070 This link opens in a new window
COBISS.SI-ID:255569667 This link opens in a new window
Publication date in RUL:14.10.2025
Views:739
Downloads:262
Metadata:XML DC-XML DC-RDF
:
Copy citation
Share:Bookmark and Share

Secondary language

Language:Slovenian
Title:Metoda za detekcijo objektov s tekstovnim poizvedovanjem
Abstract:
Naraščajoča raznolikost in obseg podatkovnih nizov za zaznavanje objektov je razkrila omejitve zaprto-množničnih detektorjev s fiksiranimi besednjaki. Zaznavanje objektov odprtih množic to rešuje tako, da omogoča zaznavanje poljubnih razredov prek tekstovnih poizvedb. Grounding DINO je uveljavljeni odprto-množični detektor, a njegova koda za učenje ni povsem odprtokodna, njegova implementacija pa zastarela. V tem delu reimplementiramo Grounding DINO, kar prinese približno ~20% pohitritev, in ga spremenimo za štetje objektov na podlagi tekstovnih poizvedb, a spremembe dosledno ne izboljšajo zmogljivosti na FSCD-147. Da bi lahko naučili model od začetka, ga še bolj optimiziramo, kar prinese dodatnih ~30% pohitritev, in razvijemo različico za robne naprave, na podlagi zaprto-kodne različice. Model učimo na 1,3 milijona slik od začetka in ga evalviramo na naborih COCO in LVIS, kjer dosega primerljive rezultate z drugimi odprtokodnimi modeli, vendar zaostaja za zaprto-kodnim osnovnim modelom, verjetno zaradi bistveno manjšega učnega nabora.

Keywords:detekcija objektov, računalniški vid, globoko učenje

Similar documents

Similar works from RUL:
Similar works from other Slovenian collections:

Back