Details

Uporaba velikih jezikovnih modelov za izboljšanje razpoznavanja slovenskega govora
ID Klemen, Anton (Author), ID Bajec, Marko (Mentor) More about this mentor... This link opens in a new window

.pdfPDF - Presentation file, Download (2,88 MB)
MD5: 78F34728017928A151855C85D0B94930

Abstract
Za slovenščino, ki sodi med jezike z manj viri, ostaja razpoznavanje govora še vedno zahtevna naloga, sodobni veliki jezikovni modeli pa s svojim bogatim jezikovnim znanjem odpirajo nove možnosti za izboljšanje njegove točnosti. V magistrski nalogi sistematično preučimo in ovrednotimo štiri skupine metod za vključevanje velikih jezikovnih modelov v sistem za razpoznavanje slovenskega govora, ki segajo od plitke integracije (ponovno ocenjevanje hipotez, pozivanje in preslikava hipotez v transkript) do globoke integracije (večmodalni model SALM). Metode preizkusimo z osmimi velikimi jezikovnimi modeli in jih primerjamo na šestih slovenskih evalvacijskih množicah z napako na ravni besed (WER) in s hitrostjo napovedovanja (RTFX). Najboljšo točnost doseže ponovno ocenjevanje z modelom SlovenianGPT (povprečni WER 10,26 %). Ugotovili smo, da so za slovenski govor veliki jezikovni modeli najučinkovitejši, kadar uporabljajo hipoteze sistema za razpoznavanje govora in jim način uporabe strogo določimo oziroma jih za nalogo doučimo. Najbolje se torej odrežejo kot ocenjevalec hipotez ali pri uglašeni preslikavi hipotez v transkript, ne pa pri prostem tvorjenju transkriptov. Analiza računske zahtevnosti pokaže, da so vse metode z velikimi jezikovnimi modeli občutno počasnejše in pomnilniško zahtevnejše od izhodiščnega razpoznavalnika, najboljši kompromis med točnostjo in hitrostjo pa med njimi ponudi preslikava hipotez v transkript.

Language:Slovenian
Keywords:obdelava naravnega jezika, razpoznavanje govora, veliki jezikovni modeli, strojno učenje
Work type:Master's thesis
Organization:FRI - Faculty of Computer and Information Science
Year:2026
PID:20.500.12556/RUL-186952 This link opens in a new window
Publication date in RUL:07.09.2026
Views:32
Downloads:10
Metadata:XML DC-XML DC-RDF
:
Copy citation
Share:Bookmark and Share

Secondary language

Language:English
Title:Utilizing large language models to improve speech recognition for Slovene language
Abstract:
For Slovene, a less-resourced language, automatic speech recognition remains a challenging task, while modern large language models, with their rich linguistic knowledge, open new possibilities for improving its accuracy. In this thesis we systematically study and evaluate four groups of methods for integrating large language models into a Slovene speech recognition system, ranging from shallow integration (hypothesis rescoring, prompting, and hypothesis-to-transcript mapping) to deep integration (the multimodal SALM model). We tested the methods with eight large language models and compared them on six Slovene evaluation sets using word error rate (WER) and inference speed (RTFX). The best accuracy is achieved by rescoring with the SlovenianGPT model (average WER 10.26 %). We found that for Slovene speech, large language models are most effective when they use speech recognition hypotheses and we strictly define how they are used or fine-tune them for the task. They therefore perform best in hypothesis rescoring or fine-tuned hypothesis-to-transcript mapping, but not in unconstrained transcript generation. The analysis of computational cost shows that all methods involving large language models are considerably slower and more memory-intensive than the baseline recognizer, with hypothesis-to-transcript mapping offering the best trade-off between accuracy and speed among them.

Keywords:natural language processing, automatic speech recognition, large language models, machine learning

Similar documents

Similar works from RUL:
Similar works from other Slovenian collections:

Back