<?xml version="1.0" encoding="utf-8"?>
<Gradivo ID="187805" NadgradivoID="0" NRID="0" OceID="0" DomainUrl="https://repozitorij.uni-lj.si/" IzpisPolniUrl="https://repozitorij.uni-lj.si/IzpisGradiva.php?lang=slv&amp;id=187805" StOgledov="12" StPrenosov="4" StOcen="0" VsotaOcen="0" DatumIzvoza="2026-09-15 09:01:54" OcenaSkupna="0" StPodgradiv="0" StudijskiProgramEvsID="1000468" JeIndeksirano="0" JeVecAvtorjev="0" DovoliZahtevkeZaDostop="0">
  <PID Url="http://hdl.handle.net/20.500.12556/RUL-187805">20.500.12556/RUL-187805</PID>
  <Naslov>Detecting hate speech using deep learning on smartphones</Naslov>
  <Podnaslov></Podnaslov>
  <TujJezik_Naslov>Zaznavanje sovražnega govora z uporabo globokega učenja na pametnih telefonih</TujJezik_Naslov>
  <TujJezik_Podnaslov></TujJezik_Podnaslov>
  <Opis>Hate speech detection is usually performed on remote servers. That requires
the text that is being checked to leave the user’s device. This thesis presents
a hate speech detection model that runs on an Android phone, and gives
each user the opportunity to personalize and adapt it to a specific sub group
of offensive language that they are the most sensitive to. All of that, without
any data leaving the device. For that purpose, a MobileBERT encoder is first
trained on the Dynahate dataset to give us a base model. The accuracy of the
base model reaches 0.805 on the test split, with a ROC-AUC of 0.84, with the
majority class baseline sitting at 0.550. After dynamic range quantization,
the classifier’s size sits at 26 MB and classifies a sentence in 64 ms on the test
device. The model is split into a frozen encoder and a classification head with
32,962 parameters. The on-device personalization trains only the head from
the user’s own feedback. Training runs were done on about 220 sentences of
feedback (sentence + label), for ten epochs at batch size 16. That takes under
a second of processor time in total, and it does not increase memory use. The
one step that does cost something is computing the sentence embeddings.
Embedding a set of about 220 sentences takes roughly 5.3 s of processor time,
and that is repeated every time a feedback set is loaded. The measurements
show that feedback containing no examples of the original task erases that
task. For that reason every training set also contains 100 sentences from the
original dataset, which prevents the loss entirely.</Opis>
  <TujJezik_Opis>Zaznavanje sovražnega govora običajno poteka na oddaljenih strežnikih. To
zahteva, da preverjano besedilo zapusti uporabnikovo napravo. V diplomskem delu predstavljamo model za zaznavanje sovražnega govora, ki teče na
telefonu z operacijskim sistemom Android in vsakemu uporabniku omogoča,
da ga personalizira in prilagodi tisti podskupini žaljivega jezika, na katero
je najbolj občutljiv. Vse to, ne da bi kakršni koli podatki zapustili napravo.
V ta namen najprej naučimo kodirnik MobileBERT na podatkovni zbirki
Dynahate in tako dobimo osnovni model. Klasifikacijska točnost osnovnega
modela na testni množici doseže 0,805, ROC-AUC pa 0,84, pri čemer je izhodiščna vrednost večinskega razreda 0,550. Po kvantizaciji z dinamičnim
območjem klasifikator zasede 26 MB in poved razvrsti v 64 ms na preizkusni
napravi. Model je razdeljen na zamrznjen kodirnik in klasifikacijsko glavo
z 32.962 parametri. Personalizacija na napravi uči samo glavo, in sicer iz
uporabnikovih lastnih povratnih informacij. Učenje je potekalo na približno
220 povedih povratnih informacij (poved in oznaka), deset epoh pri velikosti paketa 16. To skupaj porabi manj kot sekundo procesorskega časa in ne
poveča porabe pomnilnika. Edini korak, ki nekaj stane, je izračun vektorskih
vložitev povedi. Izračun vložitev za približno 220 povedi porabi približno 5,3
sekunde procesorskega časa in se ponovi vsakič, ko naložimo množico povratnih informacij. Meritve pokažejo, da povratne informacije brez primerov izvorne naloge to nalogo izbrišejo. Zato vsaka učna množica vsebuje tudi 100
povedi iz izvorne podatkovne zbirke, kar izgubo popolnoma prepreči.</TujJezik_Opis>
  <KljucneBesede>
    <Beseda>hate speech detection</Beseda>
    <Beseda>deep learning</Beseda>
    <Beseda>on-device training</Beseda>
    <Beseda>personalization</Beseda>
    <Beseda>MobileBERT</Beseda>
  </KljucneBesede>
  <TujJezik_KljucneBesede>
    <Beseda>sovražni govor</Beseda>
    <Beseda>globoko učenje</Beseda>
    <Beseda>učenje na napravi</Beseda>
    <Beseda>personalizacija</Beseda>
    <Beseda>MobileBERT</Beseda>
  </TujJezik_KljucneBesede>
  <Potrjeno>true</Potrjeno>
  <JeZaklenjeno>false</JeZaklenjeno>
  <JeRecenzirano>false</JeRecenzirano>
  <Zaloznik></Zaloznik>
  <Izvor></Izvor>
  <Jezik ID="1033" ISO639-3="eng">Angleški jezik</Jezik>
  <TujJezik ID="1060" ISO639-3="slv">Slovenski jezik</TujJezik>
  <Povezave></Povezave>
  <Pokrivanje></Pokrivanje>
  <CasovnoPokritje></CasovnoPokritje>
  <AvtorskePravice></AvtorskePravice>
  <VrstaGradiva ID="mb11" DRIVER="info:eu-repo/semantics/bachelorThesis">Diplomsko delo/naloga</VrstaGradiva>
  <DatumVstavljanja>2026-09-14 15:00:13</DatumVstavljanja>
  <DatumObjave>2026-09-14 15:00:18</DatumObjave>
  <DatumSpremembe>2026-09-15 04:27:54</DatumSpremembe>
  <DatumTrajnegaHranjenja>0000-00-00 00:00:00</DatumTrajnegaHranjenja>
  <LetoIzida>2026</LetoIzida>
  <LetoIzidaDo>0</LetoIzidaDo>
  <KrajIzida></KrajIzida>
  <LetoIzvedbe>0</LetoIzvedbe>
  <KrajIzvedbe></KrajIzvedbe>
  <Opomba></Opomba>
  <StStrani></StStrani>
  <StevilcenjeNivo1></StevilcenjeNivo1>
  <StevilcenjeNivo2></StevilcenjeNivo2>
  <Kronologija></Kronologija>
  <Patent_Stevilka></Patent_Stevilka>
  <Patent_DatumVeljavnosti>0000-00-00</Patent_DatumVeljavnosti>
  <VerzijaDokumenta>NiDoloceno</VerzijaDokumenta>
  <StatusObjaveDrugje>NiDoloceno</StatusObjaveDrugje>
  <VrstaStroskaObjave>NiDoloceno</VrstaStroskaObjave>
  <DatumPoslanoVRecenzijo>0000-00-00</DatumPoslanoVRecenzijo>
  <DatumSprejetjaClanka>0000-00-00</DatumSprejetjaClanka>
  <DatumObjaveClanka>0000-00-00</DatumObjaveClanka>
  <EmbargoDo>1970-01-01</EmbargoDo>
  <VrstaEmbarga ID="1" Naziv="Takojšnja javna objava" OpenAIREDostop="openAccess"></VrstaEmbarga>
  <Osebe>
    <Oseba ID="166051" Ime="Atanas" Priimek="Chestojanov" AltIme="" VlogaID="70" VlogaNaziv="Avtor" ConorID="" Afiliacija="" ArrsID="0" ORCID=""></Oseba>
    <Oseba ID="66254" Ime="Veljko" Priimek="Pejović" AltIme="" VlogaID="991" VlogaNaziv="Mentor" ConorID="" Afiliacija="" ArrsID="0" ORCID=""></Oseba>
  </Osebe>
  <Identifikatorji>
    <Identifikator ID="16" Sifra="VisID" Naziv="VisID" URL="">39010</Identifikator>
  </Identifikatorji>
  <Datoteke>
    <Datoteka ID="247574" DatotekaNRID="0" NamenDatotekeID="2" NamenDatoteke="Predstavitvena datoteka" FormatDatotekeID="2" FormatDatoteke=".pdf" MIME="application/pdf" IkonaFormata="pdf.png" IkonaFormataPolniUrl="https://repozitorij.uni-lj.si/teme/rulDev/img/fileTypes/pdf.png" VelikostDatoteke="966313" VelikostDatotekeKratko="943,67 KB" DatumVstavljanja="2026-09-14 15:00:19" JeZbrisana="false" JeJavnoVidna="true" JeIndeksirana="false" JeVidno="true" VidnoOd="01.01.1970" Zaporedje="0">
      <Naziv>Chestojanov_Atanas_-_Zaznavanje_sovraznega_govora_z_uporabo_globokega_ucenja_na_pametnih_telefon.pdf</Naziv>
      <OrgNaziv>Chestojanov_Atanas_-_Zaznavanje_sovraznega_govora_z_uporabo_globokega_ucenja_na_pametnih_telefon.pdf</OrgNaziv>
      <URL></URL>
      <Opis></Opis>
      <OpisTujJezik></OpisTujJezik>
      <UrlObdelave></UrlObdelave>
      <FrekvencaAzuriranjaID>1</FrekvencaAzuriranjaID>
      <Verzija></Verzija>
      <MD5>05C84FEE97D9C764B1D7ABEB47590706</MD5>
      <SHA256>dd022ddf8e98f861d1dd2a19f8c8bcf671b85d301e0340cc0b009c4b8ffed223</SHA256>
      <UUID>3460855b-b03c-11f1-8bc5-0050569b8976</UUID>
      <PID></PID>
      <PrenosPolniUrl>https://repozitorij.uni-lj.si/Dokument.php?lang=slv&amp;id=247574</PrenosPolniUrl>
      <Vsebine>
      </Vsebine>
    </Datoteka>
  </Datoteke>
  <Organizacije>
    <Organizacija OrganizacijaID="25" Kratica="FRI" ZavodEvsID="0000066" Logo="" LogoPolniUrl="https://repozitorij.uni-lj.si/teme/rulDev/img/logo/">Fakulteta za računalništvo in informatiko</Organizacija>
  </Organizacije>
  <OrganizacijeVira>
  </OrganizacijeVira>
  <MetodeZbiranjaPodatkov>
  </MetodeZbiranjaPodatkov>
  <TipologijaDela ID="0" Koda="0" Naziv="Ni določena" SchemaOrg="CreativeWork"></TipologijaDela>
  <Ostalo>
    <StIrodsDatotek>0</StIrodsDatotek>
    <StDatotekPodTrajnimEmbargom>0</StDatotekPodTrajnimEmbargom>
    <StDatotekZOmejenimDostopom>0</StDatotekZOmejenimDostopom>
  </Ostalo>
</Gradivo>
