<?xml version="1.0" encoding="utf-8"?>
<Gradivo ID="188783" NadgradivoID="0" NRID="29395758" OceID="0" DomainUrl="https://repozitorij.uni-lj.si/" IzpisPolniUrl="https://repozitorij.uni-lj.si/IzpisGradiva.php?lang=slv&amp;id=188783" StOgledov="26" StPrenosov="3" StOcen="0" VsotaOcen="0" DatumIzvoza="2026-09-28 11:54:07" OcenaSkupna="0" StPodgradiv="0" StudijskiProgramEvsID="1001052" JeIndeksirano="0" JeVecAvtorjev="0" DovoliZahtevkeZaDostop="0">
  <PID Url="http://hdl.handle.net/20.500.12556/RUL-188783">20.500.12556/RUL-188783</PID>
  <Naslov>Commonsense-enhanced deep neural networks for less-resourced languages</Naslov>
  <Podnaslov></Podnaslov>
  <TujJezik_Naslov>Z zdravorazumskim sklepanjem obogatene globoke nevronske mreže za jezike z manj viri</TujJezik_Naslov>
  <TujJezik_Podnaslov></TujJezik_Podnaslov>
  <Opis>This doctoral dissertation addresses the gap in the development of modern language technologies for Slovene, a less-resourced language that lags behind high-resource languages, particularly in the fields of text generation and complex semantic reasoning. The work combines the construction of essential data resources, the development of new methodologies for text summarization and simplification, and an in-depth analysis of the commonsense reasoning capabilities of large language models (LLMs).
In the first part, we present infrastructural improvements that serve as a foundation for training and evaluating neural models. We developed an updated version of the Corpus of Academic Slovene (KAS 2.0), which, through cleaner extraction and structural segmentation, enables the creation of dedicated datasets for long-document summarization and machine translation. For standardized evaluation of natural language understanding, we established the Slovene SuperGLUE benchmark, enabling a direct comparison of the performance of monolingual and multilingual models.
In the field of text generation, we introduce innovative approaches to address the scarcity of training data. We present a cross-lingual transfer method for summarization that leverages knowledge transfer from English models to effectively summarize Slovene news articles. We further advance the field with the development of the SloMetaSum, which, rather than seeking a universal model, employs a neural network to dynamically select the most suitable summarizer based on the content and structure of the input document. To enhance information accessibility, we designed SENTA, the first comprehensive solution for Slovene sentence simplification, combining complexity classification and generative rewriting using a fine-tuned T5 model.
The final part of the thesis focuses on commonsense reasoning. By constructing the extended KE-WSC dataset, enriched with structured ontological annotations and human explanations, we analyze the impact of explicit knowledge on model performance. The results indicate that the inclusion of explanations improves accuracy primarily in models specialized for reasoning, while also revealing a significant gap between a model&#039;s ability to solve the task and its capacity to generate high-quality justifications.
Through freely available datasets, models, and evaluation studies, this dissertation significantly contributes to the development of semantically deep and user-centric language technologies with focus on Slovene.</Opis>
  <TujJezik_Opis>Doktorska disertacija naslavlja vrzel v razvoju sodobnih jezikovnih tehnologij za slovenščino, ki kot jezik z manj viri zaostaja za prevladujočimi jeziki, zlasti na področjih generiranja besedil in zahtevnejšega semantičnega sklepanja. Delo združuje izgradnjo nujno potrebnih podatkovnih virov, razvoj novih metodologij za povzemanje in poenostavljanje besedil ter poglobljeno analizo zmožnosti zdravorazumskega sklepanja velikih jezikovnih modelov.
V prvem delu predstavimo infrastrukturne izboljšave, ki predstavljajo temelj za učenje in vrednotenje nevronskih modelov. Razvili smo prenovljeno različico Korpusa akademske slovenščine (KAS 2.0), ki s čistejšo ekstrakcijo in strukturno segmentacijo omogoča pripravo namenskih množic za povzemanje daljših dokumentov in strojno prevajanje. Za standardizirano evalvacijo razumevanja jezika smo vzpostavili slovenski nabor nalog SuperGLUE, ki omogoča neposredno primerjavo zmogljivosti enojezičnih in večjezičnih modelov.
Na področju generiranja besedil uvajamo inovativne pristope za reševanje problema pomanjkanja učnih podatkov. Predstavimo metodo medjezikovnega prenosa za povzemanje, ki s prenosom znanja iz angleških modelov omogoča učinkovito povzemanje slovenskih novic. Nadgradnjo predstavlja razvoj meta-povzemalnika SloMetaSum, ki namesto iskanja univerzalnega modela uporablja nevronsko mrežo za dinamično izbiro najprimernejšega povzemalnika glede na vsebino in strukturo vhodnega dokumenta. Za povečanje dostopnosti informacij smo zasnovali sistem SENTA, prvo celovito rešitev za poenostavljanje slovenskih stavkov, ki združuje klasifikacijo kompleksnosti in generativno preoblikovanje s prilagojenim modelom T5.
Zadnji del naloge se posveča zdravorazumskemu sklepanju. Z izgradnjo razširjene množice KE-WSC, obogatene s strukturiranimi ontološkimi oznakami in človeškimi razlagami, analiziramo vpliv eksplicitnega znanja na uspešnost modelov. Rezultati kažejo, da vključitev razlag izboljša natančnost predvsem pri modelih, specializiranih za logično sklepanje, hkrati pa razkrivajo pomemben razkorak med sposobnostjo modela, da nalogo reši, in njegovo zmožnostjo tvorjenja kakovostne utemeljitve.
Disertacija s prosto dostopnimi podatkovnimi zbirkami, modeli in evalvacijskimi študijami pomembno prispeva k razvoju semantično globokih in uporabniku prilagojenih jezikovnih tehnologij s poudarkom na slovenščini.</TujJezik_Opis>
  <KljucneBesede>
    <Beseda>natural language processing</Beseda>
    <Beseda>text summarization</Beseda>
    <Beseda>text simplification</Beseda>
    <Beseda>commonsense reasoning</Beseda>
    <Beseda>language resources for Slovene</Beseda>
    <Beseda>large language models</Beseda>
  </KljucneBesede>
  <TujJezik_KljucneBesede>
    <Beseda>obdelava naravnega jezika</Beseda>
    <Beseda>povzemanje besedil</Beseda>
    <Beseda>poenostavljanje besedil</Beseda>
    <Beseda>zdravorazumsko sklepanje</Beseda>
    <Beseda>jezikovni viri za slovenščino</Beseda>
    <Beseda>veliki jezikovni modeli</Beseda>
  </TujJezik_KljucneBesede>
  <Potrjeno>true</Potrjeno>
  <JeZaklenjeno>false</JeZaklenjeno>
  <JeRecenzirano>false</JeRecenzirano>
  <Zaloznik></Zaloznik>
  <Izvor></Izvor>
  <Jezik ID="1033" ISO639-3="eng">Angleški jezik</Jezik>
  <TujJezik ID="1060" ISO639-3="slv">Slovenski jezik</TujJezik>
  <Povezave></Povezave>
  <Pokrivanje></Pokrivanje>
  <CasovnoPokritje></CasovnoPokritje>
  <AvtorskePravice></AvtorskePravice>
  <VrstaGradiva ID="mb31" DRIVER="info:eu-repo/semantics/doctoralThesis">Doktorsko delo/naloga</VrstaGradiva>
  <DatumVstavljanja>2026-09-27 12:30:03</DatumVstavljanja>
  <DatumObjave>2026-09-27 12:30:16</DatumObjave>
  <DatumSpremembe>2026-09-28 04:30:08</DatumSpremembe>
  <DatumTrajnegaHranjenja>0000-00-00 00:00:00</DatumTrajnegaHranjenja>
  <LetoIzida>2026</LetoIzida>
  <LetoIzidaDo>0</LetoIzidaDo>
  <KrajIzida></KrajIzida>
  <LetoIzvedbe>0</LetoIzvedbe>
  <KrajIzvedbe></KrajIzvedbe>
  <Opomba></Opomba>
  <StStrani></StStrani>
  <StevilcenjeNivo1></StevilcenjeNivo1>
  <StevilcenjeNivo2></StevilcenjeNivo2>
  <Kronologija></Kronologija>
  <Patent_Stevilka></Patent_Stevilka>
  <Patent_DatumVeljavnosti>0000-00-00</Patent_DatumVeljavnosti>
  <VerzijaDokumenta>NiDoloceno</VerzijaDokumenta>
  <StatusObjaveDrugje>NiDoloceno</StatusObjaveDrugje>
  <VrstaStroskaObjave>NiDoloceno</VrstaStroskaObjave>
  <DatumPoslanoVRecenzijo>0000-00-00</DatumPoslanoVRecenzijo>
  <DatumSprejetjaClanka>0000-00-00</DatumSprejetjaClanka>
  <DatumObjaveClanka>0000-00-00</DatumObjaveClanka>
  <EmbargoDo>1970-01-01</EmbargoDo>
  <VrstaEmbarga ID="1" Naziv="Takojšnja javna objava" OpenAIREDostop="openAccess"></VrstaEmbarga>
  <Osebe>
    <Oseba ID="165191" Ime="Aleš" Priimek="Žagar" AltIme="" VlogaID="70" VlogaNaziv="Avtor" ConorID="" Afiliacija="" ArrsID="0" ORCID=""></Oseba>
    <Oseba ID="2857" Ime="Marko" Priimek="Robnik Šikonja" AltIme="Marko Robnik Šikonja; Marko Robnik- Šikonja; Marko Robnik-Šikonja; Marko Robnik; Marko Robnik-Sikonja; Marko Robnik- Sikonja" VlogaID="991" VlogaNaziv="Mentor" ConorID="4190307" Afiliacija="" ArrsID="15295" ORCID=""></Oseba>
    <Oseba ID="113020" Ime="Iztok" Priimek="Kosem" AltIme="" VlogaID="994" VlogaNaziv="Komentor" ConorID="" Afiliacija="" ArrsID="0" ORCID=""></Oseba>
  </Osebe>
  <Identifikatorji>
    <Identifikator ID="16" Sifra="VisID" Naziv="VisID" URL="">37216</Identifikator>
  </Identifikatorji>
  <Datoteke>
    <Datoteka ID="249109" DatotekaNRID="14809875" NamenDatotekeID="2" NamenDatoteke="Predstavitvena datoteka" FormatDatotekeID="2" FormatDatoteke=".pdf" MIME="application/pdf" IkonaFormata="pdf.png" IkonaFormataPolniUrl="https://repozitorij.uni-lj.si/teme/rulDev/img/fileTypes/pdf.png" VelikostDatoteke="1588125" VelikostDatotekeKratko="1,51 MB" DatumVstavljanja="2026-09-27 12:30:16" JeZbrisana="false" JeJavnoVidna="true" JeIndeksirana="false" JeVidno="true" VidnoOd="01.01.1970" Zaporedje="0">
      <Naziv>Zagar_Ales_-_Z_zdravorazumskim_sklepanjem_obogatene_globoke_nevronske_mreze_za_jezike_z_manj_vir.pdf</Naziv>
      <OrgNaziv>Zagar_Ales_-_Z_zdravorazumskim_sklepanjem_obogatene_globoke_nevronske_mreze_za_jezike_z_manj_vir.pdf</OrgNaziv>
      <URL></URL>
      <Opis></Opis>
      <OpisTujJezik></OpisTujJezik>
      <UrlObdelave></UrlObdelave>
      <FrekvencaAzuriranjaID>1</FrekvencaAzuriranjaID>
      <Verzija></Verzija>
      <MD5>41A1C55301498AB724A5CBDA8EF30BFF</MD5>
      <SHA256>225ce33304827779b64d5a0a48ef9252953f24cc09882e303083ac92fd04a10e</SHA256>
      <UUID>57076cd0-ba5e-11f1-8bc5-0050569b8976</UUID>
      <PID></PID>
      <PrenosPolniUrl>https://repozitorij.uni-lj.si/Dokument.php?lang=slv&amp;id=249109</PrenosPolniUrl>
      <Vsebine>
      </Vsebine>
    </Datoteka>
  </Datoteke>
  <Organizacije>
    <Organizacija OrganizacijaID="25" Kratica="FRI" ZavodEvsID="0000066" Logo="" LogoPolniUrl="https://repozitorij.uni-lj.si/teme/rulDev/img/logo/">Fakulteta za računalništvo in informatiko</Organizacija>
  </Organizacije>
  <OrganizacijeVira>
  </OrganizacijeVira>
  <MetodeZbiranjaPodatkov>
  </MetodeZbiranjaPodatkov>
  <TipologijaDela ID="0" Koda="0" Naziv="Ni določena" SchemaOrg="CreativeWork"></TipologijaDela>
  <Ostalo>
    <StIrodsDatotek>0</StIrodsDatotek>
    <StDatotekPodTrajnimEmbargom>0</StDatotekPodTrajnimEmbargom>
    <StDatotekZOmejenimDostopom>0</StDatotekZOmejenimDostopom>
  </Ostalo>
</Gradivo>
