<?xml version="1.0"?>
<rdf:RDF xmlns:rdf="http://www.w3.org/1999/02/22-rdf-syntax-ns#" xmlns:dc="http://purl.org/dc/elements/1.1/"><rdf:Description rdf:about="https://repozitorij.uni-lj.si/IzpisGradiva.php?id=152763"><dc:title>Samodejno urejanje slik z generativnimi modeli nevronskih omrežij na podlagi jezikovnih opisov</dc:title><dc:creator>PERNUŠ,	MARTIN	(Avtor)
	</dc:creator><dc:creator>Dobrišek,	Simon	(Mentor)
	</dc:creator><dc:subject>globoko učenje</dc:subject><dc:subject>nevronska omrežja</dc:subject><dc:subject>generativna nasprotniška omrežja</dc:subject><dc:subject>urejanje slik</dc:subject><dc:description>Področje računalniškega vida in umetne inteligence je v zadnjih letih z metodami
globokega učenja doseglo velike uspehe na področju ustvarjanja slik. V ozadju
teh rezultatov so generativni modeli globokih nevronskih omrežij, ki so zmožni
ustvarjanja fotorealističnih in vizualno prepričljivih slik različnih objektov in celo
kompleksnih scen. Kljub napredkom v ustvarjanju slik pa sta razumevanje in uporaba generativnih modelov za urejanje slik še vedno omejena. Pri tem z izrazom razumevanje
označujemo omogočanje stabilnega učenja generativnih modelov in povezavo med
latentno ter ustvarjeno (slikovno) ciljno verjetnostno porazdelitvijo podatkov.
Nad urejanjem vsakdanjih slik še ne obstaja avtomatiziran mehanizem upravljanja, ki bi omogočal urejanje le točno določenih slikovnih lastnosti. Sistemi, ki bi
omogočali urejanje slik z generativnimi modeli na podlagi jezikovnih opisov, bi
bistveno prispevali k namenom uporabe na različnih področjih, kot so avtonomna vožnja, robotika, proizvodna industrija, oblikovanje, zabavna industrija in
animacija. V takšnih sistemih bi lahko uporabnik s pomočjo besedilnega oziroma
govornega opisa vidnega prizora vplival na videz in semantično vsebino slike.
Glavna tematika doktorske disertacije je razvoj sistema generativnega nevronskega omrežja v kombinaciji z jezikovnim opisom, pri čemer je cilj izluščiti informacijo o želenih lastnostih oz. spremembah slik iz jezikovnih opisov in to informacijo uporabiti za urejanje slik. Izhodišče za naše raziskave so generativna
nevronska omrežja, ki jih gradimo tako, da glede na jezikovno ali bolj strukturirano informacijo ustvarimo oziroma uredimo ˇzeleno sliko. V sklopu doktorske
disertacije predstavimo več različnih izvirnih prispevkov.
Prvi izvirni prispevek je nova metoda za urejanje obraznih lastnosti, imenovana MaskFaceGAN. Predstavljena metoda glede na generativni model slik omogoča manipulacijo različnih obraznih lastnosti (npr. barvo las, tip obrvi, velikost nosu). Ciljno jezikovno informacijo, ki je zahtevana za urejanje obraza, podamo v obliki izbire in intenzivnosti določene obrazne lastnosti. S posebnim procesom invertiranja generativnega omrežja predlagana rešitev omogoča visokoločljivostno urejanje obrazov, ki omogoča tudi hkratno urejanje več lastnosti in spremembo velikosti posameznih delov obraza. Na različnih podatkovnih zbirkah opravimo eksperimente in uporabniško študijo, ki kažejo na prednosti predlagane metode MaskFaceGAN v primerjavi s konkurenčnimi tehnologijami.
Naslednji izvirni prispevek je metoda ChildNet, model, ki lahko napove videz otrok glede na slike staršev. ChildNet omogoča sintezo slike otroka glede na vhodni sliki staršev, pri čemer lahko modelu dodamo tudi jezikovno informacijo v obliki dodatnih zahtev glede videza otroka (starost in spol). Prav tako predstavimo novo visokoločljivostno podatkovno zbirko, namenjeno učenju modelov za sintezo slik glede na sorodstvena razmerja. ChildNet ovrednotimo v primerjavi s konkurenčnimi tehnologijami, pri tem pa naša metoda natančneje oceni videz otroka, pri čemer je nastala slika visoke kakovosti in ločljivosti.
Zadnji izvirni prispevek predstavlja metodo FICE, ki se osredotoča na besedilno pogojeno urejanje modnih slik. Jezikovna informacije je pri tem podana v najbolj surovi obliki, tj. v obliki besedilnega opisa. Metoda je sposobna obdelave besedilnih opisov, ki lahko izražajo širok besedni zaklad. Koncept urejanja slike temelji na invertiranju generativnega omrežja, ki ga nadgradimo z več omejitvami, kot so semantična omejitev, omejitev slikovne kompozicije, omejitev drže in regularizacija latentne kode. Omejitve so realizirane s prednaučenimi odvedljivimi nevronskimi omrežji, pri katerih je sam model specializiran za urejanje modnih slik. Za oceno kakovosti metode predlagamo več različnih metrik, ki se osredotočajo na kakovost slik, ohranitev drže osebe, semantično ustreznost in ohranitev identitete. Metode primerjamo z drugimi tehnologijami besedilno pogojenega urejanja slik, kjer se izkaže, da je metoda FICE boljša v vseh testiranih metrikah.
Če povzamemo, se vsi izvirni prispevki osredotočajo na razumevanje in gradnjo generativnih modelov oziroma razvoj sistemov, pri katerih ciljno jezikovno informacijo vnesemo v naš model za ustvarjanje želene slike. Rezultati raziskav kažejo na potencial generativnih modelov za urejanje slik in pomen razumevanja povezave med latentnimi in ciljnimi verjetnostnimi porazdelitvami. Predlagane metode in sistemi lahko pomembno prispevajo k široki paleti namenom uporabe na različnih področjih.</dc:description><dc:date>2023</dc:date><dc:date>2023-12-06 11:30:28</dc:date><dc:type>Doktorsko delo/naloga</dc:type><dc:identifier>152763</dc:identifier><dc:language>sl</dc:language></rdf:Description></rdf:RDF>
