Podrobno

Uporaba velikih jezikovnih modelov za izboljšanje razpoznavanja slovenskega govora
ID Klemen, Anton (Avtor), ID Bajec, Marko (Mentor) Več o mentorju... Povezava se odpre v novem oknu

.pdfPDF - Predstavitvena datoteka, prenos (2,88 MB)
MD5: 78F34728017928A151855C85D0B94930

Izvleček
Za slovenščino, ki sodi med jezike z manj viri, ostaja razpoznavanje govora še vedno zahtevna naloga, sodobni veliki jezikovni modeli pa s svojim bogatim jezikovnim znanjem odpirajo nove možnosti za izboljšanje njegove točnosti. V magistrski nalogi sistematično preučimo in ovrednotimo štiri skupine metod za vključevanje velikih jezikovnih modelov v sistem za razpoznavanje slovenskega govora, ki segajo od plitke integracije (ponovno ocenjevanje hipotez, pozivanje in preslikava hipotez v transkript) do globoke integracije (večmodalni model SALM). Metode preizkusimo z osmimi velikimi jezikovnimi modeli in jih primerjamo na šestih slovenskih evalvacijskih množicah z napako na ravni besed (WER) in s hitrostjo napovedovanja (RTFX). Najboljšo točnost doseže ponovno ocenjevanje z modelom SlovenianGPT (povprečni WER 10,26 %). Ugotovili smo, da so za slovenski govor veliki jezikovni modeli najučinkovitejši, kadar uporabljajo hipoteze sistema za razpoznavanje govora in jim način uporabe strogo določimo oziroma jih za nalogo doučimo. Najbolje se torej odrežejo kot ocenjevalec hipotez ali pri uglašeni preslikavi hipotez v transkript, ne pa pri prostem tvorjenju transkriptov. Analiza računske zahtevnosti pokaže, da so vse metode z velikimi jezikovnimi modeli občutno počasnejše in pomnilniško zahtevnejše od izhodiščnega razpoznavalnika, najboljši kompromis med točnostjo in hitrostjo pa med njimi ponudi preslikava hipotez v transkript.

Jezik:Slovenski jezik
Ključne besede:obdelava naravnega jezika, razpoznavanje govora, veliki jezikovni modeli, strojno učenje
Vrsta gradiva:Magistrsko delo
Organizacija:FRI - Fakulteta za računalništvo in informatiko
Leto izida:2026
PID:20.500.12556/RUL-186952 Povezava se odpre v novem oknu
Datum objave v RUL:07.09.2026
Število ogledov:28
Število prenosov:10
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Sekundarni jezik

Jezik:Angleški jezik
Naslov:Utilizing large language models to improve speech recognition for Slovene language
Izvleček:
For Slovene, a less-resourced language, automatic speech recognition remains a challenging task, while modern large language models, with their rich linguistic knowledge, open new possibilities for improving its accuracy. In this thesis we systematically study and evaluate four groups of methods for integrating large language models into a Slovene speech recognition system, ranging from shallow integration (hypothesis rescoring, prompting, and hypothesis-to-transcript mapping) to deep integration (the multimodal SALM model). We tested the methods with eight large language models and compared them on six Slovene evaluation sets using word error rate (WER) and inference speed (RTFX). The best accuracy is achieved by rescoring with the SlovenianGPT model (average WER 10.26 %). We found that for Slovene speech, large language models are most effective when they use speech recognition hypotheses and we strictly define how they are used or fine-tune them for the task. They therefore perform best in hypothesis rescoring or fine-tuned hypothesis-to-transcript mapping, but not in unconstrained transcript generation. The analysis of computational cost shows that all methods involving large language models are considerably slower and more memory-intensive than the baseline recognizer, with hypothesis-to-transcript mapping offering the best trade-off between accuracy and speed among them.

Ključne besede:natural language processing, automatic speech recognition, large language models, machine learning

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Nazaj