Podrobno

Segmentacija objektov skozi transformacije z uporabo modela SAM
ID Jezovšek, Gašper (Avtor), ID Lukežič, Alan (Mentor) Več o mentorju... Povezava se odpre v novem oknu

.pdfPDF - Predstavitvena datoteka, prenos (8,28 MB)
MD5: DF0EFA23E99DDA39140CC310BE8A9F36

Izvleček
Segmentacija in sledenje objektov v videu sta zreli področji, sodobni modeli, kot je SAM2, pa objektom sledijo predvsem na podlagi videza. Kadar objekt med posnetkom bistveno spremeni obliko, na primer med rezanjem, lomljenjem ali gnetenjem, razpade na več delov in sledenje pogosto odpove. V diplomskem delu prilagodimo modela družine Segment Anything za segmentacijo objektov skozi tovrstne transformacije. Model SAM2 doučimo na podatkovni zbirki VOST prek obstoječega učnega cevovoda, za model SAM3 pa razvijemo lasten postopek videoučenja sledilnika, pri katerem gradienti tečejo skozi časovni pomnilnik, tako da se ta med učenjem prilagodi nalogi. Doučenje izboljša oba modela: povprečno prekrivanje (J) naraste z 0,471 na 0,539 pri SAM2 in z 0,536 na 0,614 pri SAM3, pri čemer je izboljšava največja prav v tistih delih posnetka, kjer se objekt preoblikuje. Doučeni model dosega tudi najboljši rezultat na tekmovanju VOTSt2025. Ovrednotimo tudi prenosljivost na običajne objekte in pokažemo, da specializacija na razpadajoče objekte zniža natančnost pri njih.

Jezik:Slovenski jezik
Ključne besede:segmentacija objektov, sledenje objektom v videu, transformacije objektov, SAM, doučenje, VOST
Vrsta gradiva:Diplomsko delo/naloga
Tipologija:2.11 - Diplomsko delo
Organizacija:FRI - Fakulteta za računalništvo in informatiko
Leto izida:2026
PID:20.500.12556/RUL-185790 Povezava se odpre v novem oknu
COBISS.SI-ID:289079811 Povezava se odpre v novem oknu
Datum objave v RUL:20.08.2026
Število ogledov:171
Število prenosov:93
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Sekundarni jezik

Jezik:Angleški jezik
Naslov:Object segmentation through transformations using the SAM model
Izvleček:
Video object segmentation and tracking are mature fields, yet modern models such as SAM2 track objects mainly by their appearance. When an object substantially changes shape during a sequence, for example while being cut, broken, or kneaded, it falls apart into several pieces and tracking often fails. In this thesis we adapt models of the Segment Anything family for object segmentation through such transformations. We fine-tune SAM2 on the VOST dataset using the model’s existing training pipeline, while for SAM3 we develop our own video-training procedure for the tracker, in which gradients flow through the temporal memory so that it adapts to the task during training. Fine-tuning improves both models: the mean region overlap (J) rises from 0.471 to 0.539 for SAM2 and from 0.536 to 0.614 for SAM3, with the largest gains precisely on the sequence sections where transformations happen. Our fine-tuned model also achieves the best result on the VOTSt2025 challenge. We also evaluate transfer to ordinary objects and show that specialising for disintegrating objects reduces accuracy on them.

Ključne besede:object segmentation, video object tracking, object transformations, SAM, fine-tuning, VOST

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Nazaj