<?xml version="1.0" encoding="utf-8"?>
<Gradivo ID="186952" NadgradivoID="0" NRID="29207256" OceID="0" DomainUrl="https://repozitorij.uni-lj.si/" IzpisPolniUrl="https://repozitorij.uni-lj.si/IzpisGradiva.php?lang=slv&amp;id=186952" StOgledov="39" StPrenosov="13" StOcen="0" VsotaOcen="0" DatumIzvoza="2026-09-08 08:24:27" OcenaSkupna="0" StPodgradiv="0" StudijskiProgramEvsID="1001017" JeIndeksirano="0" JeVecAvtorjev="0" DovoliZahtevkeZaDostop="0">
  <PID Url="http://hdl.handle.net/20.500.12556/RUL-186952">20.500.12556/RUL-186952</PID>
  <Naslov>Uporaba velikih jezikovnih modelov za izboljšanje razpoznavanja slovenskega govora</Naslov>
  <Podnaslov></Podnaslov>
  <TujJezik_Naslov>Utilizing large language models to improve speech recognition for Slovene language</TujJezik_Naslov>
  <TujJezik_Podnaslov></TujJezik_Podnaslov>
  <Opis>Za slovenščino, ki sodi med jezike z manj viri, ostaja razpoznavanje govora še vedno zahtevna naloga, sodobni veliki jezikovni modeli pa s svojim bogatim jezikovnim znanjem odpirajo nove možnosti za izboljšanje njegove točnosti. V magistrski nalogi sistematično preučimo in ovrednotimo štiri skupine metod za vključevanje velikih jezikovnih modelov
v sistem za razpoznavanje slovenskega govora, ki segajo od plitke integracije (ponovno ocenjevanje hipotez, pozivanje in preslikava hipotez v transkript) do globoke integracije (večmodalni model SALM). Metode preizkusimo z osmimi velikimi jezikovnimi modeli
in jih primerjamo na šestih slovenskih evalvacijskih množicah z napako na ravni besed (WER) in s hitrostjo napovedovanja (RTFX). Najboljšo točnost doseže ponovno ocenjevanje z modelom SlovenianGPT (povprečni WER 10,26 %). Ugotovili smo, da so za slovenski govor veliki jezikovni modeli najučinkovitejši, kadar uporabljajo hipoteze
sistema za razpoznavanje govora in jim način uporabe strogo določimo oziroma jih za nalogo doučimo. Najbolje se torej odrežejo kot ocenjevalec hipotez ali pri uglašeni preslikavi hipotez v transkript, ne pa pri prostem tvorjenju transkriptov. Analiza računske zahtevnosti pokaže, da so vse metode z velikimi jezikovnimi modeli občutno počasnejše in pomnilniško zahtevnejše od izhodiščnega razpoznavalnika, najboljši kompromis med točnostjo in hitrostjo pa med njimi ponudi preslikava hipotez v transkript.</Opis>
  <TujJezik_Opis>For Slovene, a less-resourced language, automatic speech recognition remains a challenging task, while modern large language models, with their rich linguistic knowledge, open new possibilities for improving its accuracy. In this thesis we systematically study and evaluate four groups of methods for integrating large language models into a Slovene speech recognition system, ranging from shallow integration (hypothesis rescoring, prompting, and hypothesis-to-transcript mapping) to deep integration (the multimodal SALM model). We tested the methods with eight large language models and compared them on six Slovene evaluation sets using word error rate (WER) and inference speed (RTFX). The best accuracy is achieved by rescoring with the SlovenianGPT model (average WER 10.26 %). We found that for Slovene speech, large language models are most effective when they use speech recognition hypotheses and we strictly define how they are used or fine-tune them for the task. They therefore perform best in hypothesis rescoring or fine-tuned hypothesis-to-transcript mapping, but not in unconstrained transcript generation. The analysis of computational cost shows that all methods involving large language models are considerably slower and more memory-intensive than the baseline recognizer, with hypothesis-to-transcript mapping offering the best trade-off between accuracy and speed among them.</TujJezik_Opis>
  <KljucneBesede>
    <Beseda>obdelava naravnega jezika</Beseda>
    <Beseda>razpoznavanje govora</Beseda>
    <Beseda>veliki jezikovni modeli</Beseda>
    <Beseda>strojno učenje</Beseda>
  </KljucneBesede>
  <TujJezik_KljucneBesede>
    <Beseda>natural language processing</Beseda>
    <Beseda>automatic speech recognition</Beseda>
    <Beseda>large language models</Beseda>
    <Beseda>machine learning</Beseda>
  </TujJezik_KljucneBesede>
  <Potrjeno>true</Potrjeno>
  <JeZaklenjeno>false</JeZaklenjeno>
  <JeRecenzirano>false</JeRecenzirano>
  <Zaloznik></Zaloznik>
  <Izvor></Izvor>
  <Jezik ID="1060" ISO639-3="slv">Slovenski jezik</Jezik>
  <TujJezik ID="1033" ISO639-3="eng">Angleški jezik</TujJezik>
  <Povezave></Povezave>
  <Pokrivanje></Pokrivanje>
  <CasovnoPokritje></CasovnoPokritje>
  <AvtorskePravice></AvtorskePravice>
  <VrstaGradiva ID="m2" DRIVER="info:eu-repo/semantics/masterThesis">Magistrsko delo</VrstaGradiva>
  <DatumVstavljanja>2026-09-07 15:45:10</DatumVstavljanja>
  <DatumObjave>2026-09-07 15:45:19</DatumObjave>
  <DatumSpremembe>2026-09-08 04:19:45</DatumSpremembe>
  <DatumTrajnegaHranjenja>0000-00-00 00:00:00</DatumTrajnegaHranjenja>
  <LetoIzida>2026</LetoIzida>
  <LetoIzidaDo>0</LetoIzidaDo>
  <KrajIzida></KrajIzida>
  <LetoIzvedbe>0</LetoIzvedbe>
  <KrajIzvedbe></KrajIzvedbe>
  <Opomba></Opomba>
  <StStrani></StStrani>
  <StevilcenjeNivo1></StevilcenjeNivo1>
  <StevilcenjeNivo2></StevilcenjeNivo2>
  <Kronologija></Kronologija>
  <Patent_Stevilka></Patent_Stevilka>
  <Patent_DatumVeljavnosti>0000-00-00</Patent_DatumVeljavnosti>
  <VerzijaDokumenta>NiDoloceno</VerzijaDokumenta>
  <StatusObjaveDrugje>NiDoloceno</StatusObjaveDrugje>
  <VrstaStroskaObjave>NiDoloceno</VrstaStroskaObjave>
  <DatumPoslanoVRecenzijo>0000-00-00</DatumPoslanoVRecenzijo>
  <DatumSprejetjaClanka>0000-00-00</DatumSprejetjaClanka>
  <DatumObjaveClanka>0000-00-00</DatumObjaveClanka>
  <EmbargoDo>1970-01-01</EmbargoDo>
  <VrstaEmbarga ID="1" Naziv="Takojšnja javna objava" OpenAIREDostop="openAccess"></VrstaEmbarga>
  <Osebe>
    <Oseba ID="88179" Ime="Anton" Priimek="Klemen" AltIme="" VlogaID="70" VlogaNaziv="Avtor" ConorID="" Afiliacija="" ArrsID="0" ORCID=""></Oseba>
    <Oseba ID="23464" Ime="Marko" Priimek="Bajec" AltIme="" VlogaID="991" VlogaNaziv="Mentor" ConorID="4370019" Afiliacija="" ArrsID="16154" ORCID=""></Oseba>
  </Osebe>
  <Identifikatorji>
    <Identifikator ID="16" Sifra="VisID" Naziv="VisID" URL="">38630</Identifikator>
  </Identifikatorji>
  <Datoteke>
    <Datoteka ID="246357" DatotekaNRID="14780336" NamenDatotekeID="2" NamenDatoteke="Predstavitvena datoteka" FormatDatotekeID="2" FormatDatoteke=".pdf" MIME="application/pdf" IkonaFormata="pdf.png" IkonaFormataPolniUrl="https://repozitorij.uni-lj.si/teme/rulDev/img/fileTypes/pdf.png" VelikostDatoteke="3023887" VelikostDatotekeKratko="2,88 MB" DatumVstavljanja="2026-09-07 15:45:34" JeZbrisana="false" JeJavnoVidna="true" JeIndeksirana="false" JeVidno="true" VidnoOd="01.01.1970" Zaporedje="0">
      <Naziv>Klemen_Anton_-_Uporaba_velikih_jezikovnih_modelov_za_izboljsanje_razpoznavanja_slovenskega_govor.pdf</Naziv>
      <OrgNaziv>Klemen_Anton_-_Uporaba_velikih_jezikovnih_modelov_za_izboljsanje_razpoznavanja_slovenskega_govor.pdf</OrgNaziv>
      <URL></URL>
      <Opis></Opis>
      <OpisTujJezik></OpisTujJezik>
      <UrlObdelave></UrlObdelave>
      <FrekvencaAzuriranjaID>1</FrekvencaAzuriranjaID>
      <Verzija></Verzija>
      <MD5>78F34728017928A151855C85D0B94930</MD5>
      <SHA256>2020ad550274f0882e45d0baf803d0a9aceec27da3b2896ebb1482db53d01c6e</SHA256>
      <UUID>62a87ced-aac2-11f1-8bc5-0050569b8976</UUID>
      <PID></PID>
      <PrenosPolniUrl>https://repozitorij.uni-lj.si/Dokument.php?lang=slv&amp;id=246357</PrenosPolniUrl>
      <Vsebine>
      </Vsebine>
    </Datoteka>
  </Datoteke>
  <Organizacije>
    <Organizacija OrganizacijaID="25" Kratica="FRI" ZavodEvsID="0000066" Logo="" LogoPolniUrl="https://repozitorij.uni-lj.si/teme/rulDev/img/logo/">Fakulteta za računalništvo in informatiko</Organizacija>
  </Organizacije>
  <OrganizacijeVira>
  </OrganizacijeVira>
  <MetodeZbiranjaPodatkov>
  </MetodeZbiranjaPodatkov>
  <TipologijaDela ID="0" Koda="0" Naziv="Ni določena" SchemaOrg="CreativeWork"></TipologijaDela>
  <Ostalo>
    <StIrodsDatotek>0</StIrodsDatotek>
    <StDatotekPodTrajnimEmbargom>0</StDatotekPodTrajnimEmbargom>
    <StDatotekZOmejenimDostopom>0</StDatotekZOmejenimDostopom>
  </Ostalo>
</Gradivo>
