<?xml version="1.0"?>
<metadata xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xmlns:dc="http://purl.org/dc/elements/1.1/"><dc:title>Napovedovanje vrednosti onesnaževal v zraku s tehnikami strojnega učenja</dc:title><dc:creator>Katanec,	Jernej	(Avtor)
	</dc:creator><dc:creator>Guid,	Matej	(Mentor)
	</dc:creator><dc:creator>Faganeli Pucer,	Jana	(Komentor)
	</dc:creator><dc:subject>napovedovanje onesnaženosti zraka</dc:subject><dc:subject>napovedovanje vrednosti časovnih vrst</dc:subject><dc:subject>nevronske mreže z dolgim kratkoročnim spominom</dc:subject><dc:subject>ekstremno gradientno spodbujanje</dc:subject><dc:subject>ozon</dc:subject><dc:description>V današnjem času onesnaženost zraka predstavlja enega izmed največjih problemov na svetu. V Sloveniji v zadnjih letih beležimo povišane vrednosti dveh onesnaževal, delcev $PM_{10}$ in ozona ($O_3$). Daljša izpostavljenost njunim visokim vrednostim lahko negativno vpliva na zdravje ljudi, zato je zelo pomembno, da znamo natančno napovedati vrednosti teh dveh onesnaževal v zraku. Na ta način lahko sprejmemo preventivne ukrepe, kot je omejeno gibanje na prostem v času povišanih vrednosti $O_3$ ali omejitev prometa v mestih, kar zavira nadaljnje onesnaževanje zraka s $PM_{10}$ delci.

V tem delu smo izmerjene vrednosti $PM_{10}$ in $O_3$ predstavili kot časovni vrsti. Iskali smo najboljša modela za napovedovanje njunih dnevnih vrednosti en dan vnaprej. Preizkusili smo model z ekstremnim gradientnim spodbujanjem (XGBoost) in nevronsko mrežo z dolgim kratkoročnim spominom (LSTM) ter njuno učinkovitost primerjali z integriranim avtoregresijskim modelom z drsečimi sredinami (ARIMA). XGBoost je ansambel algoritmov za strojno učenje, ki temelji na odločitvenih drevesih, LSTM pa vrsta nevronske mreže, ki ima sposobnost učenja dolgoročnih odvisnosti. Vsakemu modelu smo poiskali optimalne parametre ter tehnike obdelave časovne vrste, pri modelu LSTM pa smo preizkusili tri različne arhitekture.

Sprva smo modela zgradili tako, kot da napovedujeta ob koncu dneva, torej ob polnoči. V realnosti se napovedi opravljajo v poznih jutranjih urah, saj so do takrat na voljo meteorološki podatki jutra za tekoči dan, napovedane vrednosti pa so koristne v času, ko se začnejo ljudje v večjem številu gibati na prostem. Ta pristop smo nato ubrali tudi mi in izkazalo se je, da tako dobimo boljše rezultate.

Napovedi smo izboljšali z značilkami, izpeljanimi iz meteoroloških napovedi za tekoči dan, iz meteoroloških podatkov za prejšnji dan in podatkov za tekoči dan do časa napovedi. Izkazalo se je, da k boljšim napovedim vrste $O_3$ največ prispevajo meteorološke napovedi, predvsem sončnega sevanja, oblačnosti in padavin, medtem ko so pri napovedovanju vrste $PM_{10}$ najpomembnejše meteorološke meritve za tekoči dan do trenutka napovedi, predvsem podatki o temperaturni inverziji in temperaturi ozračja. Poskusi so pokazali, da se pomembnosti značilk spremenijo, če vrst pred napovedovanjem ne obdelamo, ter da se pomembnosti značilk razlikujejo po posameznih letnih časih.

Rezultati poskusov so pokazali, da dobimo najboljše rezultate z uporabo nevronske mreže LSTM, pri čemer uporabimo dvosmerno arhitekturo. Rezultate smo izboljšali, če smo obravnavanima vrstama odstranili letno ter tedensko sezonsko komponento in ju normalizirali. S primerjavo dveh različnih pristopov napovedovanja smo pokazali, da dobimo boljše rezultate, če za napovedi uporabimo daljšo učno množico.</dc:description><dc:date>2021</dc:date><dc:date>2021-09-18 08:15:07</dc:date><dc:type>Magistrsko delo/naloga</dc:type><dc:identifier>130867</dc:identifier><dc:identifier>VisID: 120314</dc:identifier><dc:identifier>COBISS_ID: 76527363</dc:identifier><dc:language>sl</dc:language></metadata>
