Podrobno

Pristranskost v strojnem učenju: primer COMPAS : magistrsko delo
ID Farič, Ana (Avtor), ID Bratko, Ivan (Mentor) Več o mentorju... Povezava se odpre v novem oknu

.pdfPDF - Predstavitvena datoteka, prenos (5,83 MB)
MD5: B8F696C79CF959C2264C32C741CBB3A1

Izvleček
Sistem COMPAS, ki se v ameriškem pravosodju uporablja za napovedovanje povratništva, predstavlja enega najbolj polemičnih primerov uporabe strojnega učenja. Leta 2016 je prispevek v reviji ProPublica sprožil razpravo o njegovi domnevni rasni pristranskosti. Zaradi pomanjkanja univerzalne definicije pristranskosti in nasprotujočih si kriterijev pravičnosti pa še danes ni konsenza, ali je sistem pristranski. Delo združuje teoretično sintezo tehničnih, pravnih in družbenih vidikov pristranskosti. Natančno sem dokumentirala atribute in analizirala podatkovno zbirko, ki so jo objavili avtorji ProPublice in se od leta 2016 pogosto uporablja za preučevanje pristranskosti. V empiričnem delu sem eksperimentalno potrdila ugotovitve predhodnih študij, da bolj kompleksni modeli (nevronske mreže) ne dosegajo večje napovedne točnosti kot enostavnejši modeli (odločitvena drevesa, logistična regresija, odločitvena pravila). Prav tako sem reproducirala vzorec napak, kjer imajo temnopolti višji delež napačnih pozitivnih napovedi (FPR), belci pa višji delež napačnih negativnih napovedi (FNR). Kot ključna mehanizma, ki prispevata k tem razlikam, sem opredelila 1) porazdelitev učnih podatkov (predvsem razlike v osnovni stopnji povratništva ter v distribuciji starosti in predhodnih kaznivih dejanj med skupinama) in 2) postopek binarizacije verjetnostnih ocen, ki razlike med skupinama še poveča. Poskus napovedovanja rase na podlagi preostalih atributov kaže, da modeli rase na podlagi preostalih podatkov ne rekonstruirajo zanesljivo, kar omejuje argument o približkih. Prav tako je končna ocena pristranskosti modelov odvisna od izbranega kriterija. Po kriteriju izenačenih možnosti so vsi analizirani modeli pristranski, po kriteriju napovedne paritete pa nepristranski. Ugotovitve pojasnjujejo nasprotujoče si zaključke preteklih raziskav in poudarjajo pomen upoštevanja verjetnostnih ocen in izvorne porazdelitve učnih podatkov pri vrednotenju modelov strojnega učenja.

Jezik:Slovenski jezik
Ključne besede:umetna inteligenca, strojno učenje, pristranskost, pravičnost, sistem COMPAS
Vrsta gradiva:Magistrsko delo/naloga
Tipologija:2.09 - Magistrsko delo
Organizacija:PEF - Pedagoška fakulteta
Kraj izida:Ljubljana
Založnik:A. Farič
Leto izida:2026
Št. strani:94 str.
PID:20.500.12556/RUL-188450 Povezava se odpre v novem oknu
UDK:004.8(043.2)
COBISS.SI-ID:292361475 Povezava se odpre v novem oknu
Datum objave v RUL:23.09.2026
Število ogledov:81
Število prenosov:13
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Sekundarni jezik

Jezik:Angleški jezik
Naslov:Machine bias: the COMPAS example
Izvleček:
The COMPAS system, used in the US justice system to predict recidivism, represents one of the most controversial applications of machine learning. In 2016, a ProPublica article sparked a debate regarding its alleged racial bias. Due to the lack of a universal definition of bias and conflicting fairness criteria, there is still no consensus today on whether the system is biased. The thesis combines a theoretical synthesis of the technical, legal, and social aspects of bias. I meticulously documented the attributes and analyzed the dataset published by the ProPublica authors, which has been widely used to study bias since 2016. In the empirical section, I experimentally confirmed the findings of previous studies that more complex models (decision trees, logistic regressino, decision rules). I also reproduced the error pattern where Black defendants have a higher false positive rate (FPR), while White defendants have a higher false negative rate (FNR). I identified two key mechanisms contributing to these disparities: 1) the distribution of training data (primarily the difference in the base recidivism rate, as well as the distribution of age and prior offenses between the groups), and 2) the binarization process of probability scores, which further amplifies the differences between the groups. The attempt to predict race based on the remaining attributes shows that models do not reliably reconstruct race from the remaining data, which limits the argument about proxies. Furthermore, the final assessment of model bias depends on the selected fairness criterion. According to the equalized odds criterion, all analyzed models are biased, whereas under the predictive parity criterion, they are unbiased. The findings explain the contradictory conclusions of past research and emphasize the necessity of considering probability scores and the original distribution of training data when evaluating machine learning models.

Ključne besede:artificial intelligence, machine learning, bias, fairness, COMPAS

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Nazaj