<?xml version="1.0"?>
<metadata xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xmlns:dc="http://purl.org/dc/elements/1.1/"><dc:title>Primerjava mešanih modelov in modelov strojnega učenja za napovedovanje longitudinalnih podatkov</dc:title><dc:creator>Ratajec,	Mariša	(Avtor)
	</dc:creator><dc:creator>Blagus,	Rok	(Mentor)
	</dc:creator><dc:subject>longitudinalni podatki</dc:subject><dc:subject>linearni mešani modeli</dc:subject><dc:subject>analiza z mejnikom</dc:subject><dc:subject>strojno učenje</dc:subject><dc:subject>napovedovanje</dc:subject><dc:subject>simulacijska študija</dc:subject><dc:subject>diagnostika prileganja</dc:subject><dc:description>Napovedovanje prihodnjih vrednosti pri longitudinalnih podatkih je zahtevno, saj so ponavljajoče se meritve istega posameznika med seboj povezane. Poleg tega ob času napovedovanja prihodnje vrednosti časovno odvisnih pojasnjevalnih spremenljivk praviloma še niso znane. V magistrskem delu smo primerjali linearne mešane modele in metode strojnega učenja ter preverili, kako na njihovo napovedno uspešnost vplivajo velikost učne množice, napačna specifikacija modela in način uporabe preteklih meritev posameznika.

Primerjava je temeljila na simulacijski študiji s 100 Monte Carlo ponovitvami in štirimi scenariji generiranja podatkov. V vsaki ponovitvi je bilo ustvarjenih 1000 oseb z 12 meritvami. Podatki so bili uravnoteženi in brez manjkajočih vrednosti. Iz iste populacije so bile oblikovane ugnezdene učne množice s 50, 100 in 250 osebami, preostalih 750 oseb pa je tvorilo skupno testno množico. Pri testnih osebah je bilo prvih osem meritev znanih, napovedovali pa smo zadnje štiri. Primerjali smo linearni model, več različic linearnega mešanega modela (LMM), LMM z mejnikom, naključni gozd in XGBoost. Napovedi zadnjih štirih meritev smo ovrednotili z RMSE, MAE in pristranskostjo. Pri klasičnem LMM smo dodatno preverjali ustreznost fiksnega in naključnega dela modela z diagnostičnim testom. 

Rezultati niso pokazali enega najboljšega modela za vse okoliščine. Najboljši pristop je bil odvisen od scenarija in velikosti učne množice. Pri manjših učnih množicah sta bila praviloma najuspešnejša klasični ali scenarijsko prilagojeni LMM, pri 250 učnih osebah pa je LMM z mejnikom dosegel najnižji povprečni RMSE in MAE v vseh štirih scenarijih.  Napačna specifikacija linearnega mešanega modela je praviloma poslabšala napovedno uspešnost. Uporabljena diagnostika je uspešno zaznavala odstopanja v fiksnem in naključnem delu modela. Pri naključnem gozdu in XGBoostu večje število značilk samo po sebi ni zagotavljalo boljše napovedi. 

Uspešnost je bila odvisna od tega, kako dobro je vhodna predstavitev odražala časovno strukturo podatkov. Ugotovitve kažejo, da je treba model za longitudinalno napovedovanje izbrati glede na strukturo podatkov, velikost učne množice in razpoložljivo zgodovino. Diagnostika prileganja in vrednotenje na novih osebah se pri tem dopolnjujeta: prva opozori na možno strukturno neskladje, drugo pa pokaže, ali sprememba modela dejansko izboljša napovedi.</dc:description><dc:date>2026</dc:date><dc:date>2026-09-03 10:30:04</dc:date><dc:type>Magistrsko delo/naloga</dc:type><dc:identifier>186608</dc:identifier><dc:identifier>VisID: 63422</dc:identifier><dc:identifier>COBISS_ID: 290461443</dc:identifier><dc:language>sl</dc:language></metadata>
