Naslov diplomskega dela: Segmentacija objektov skozi transformacije z uporabo modela SAM
Povzetek:
Segmentacija in sledenje objektov v videu sta zreli področji, sodobni modeli, kot je SAM2, pa objektom sledijo predvsem na podlagi videza. Kadar objekt med posnetkom bistveno spremeni obliko, na primer med rezanjem, lomljenjem ali gnetenjem, razpade na več delov in sledenje pogosto odpove. V diplomskem delu prilagodimo modela družine Segment Anything za segmentacijo objektov skozi tovrstne transformacije. Model SAM2 doučimo na podatkovni zbirki VOST prek obstoječega učnega cevovoda, za model SAM3 pa razvijemo lasten postopek videoučenja sledilnika, pri katerem gradienti tečejo skozi časovni pomnilnik, tako da se ta med učenjem prilagodi nalogi. Doučenje izboljša oba modela: povprečno prekrivanje (J) naraste z 0,471 na 0,539 pri SAM2 in z 0,536 na 0,614 pri SAM3, pri čemer je izboljšava največja prav v tistih delih posnetka, kjer se objekt preoblikuje. Doučeni model dosega tudi najboljši rezultat na tekmovanju VOTSt2025. Ovrednotimo tudi prenosljivost na običajne objekte in pokažemo, da specializacija na razpadajoče objekte zniža natančnost pri njih.