Podrobno

Analiza uporabe velikih jezikovnih modelov pri obdelavi predlogov državljanov na portalu predlagam vladi : diplomsko delo
ID Likar, Nik (Avtor), ID Dečman, Mitja (Mentor) Več o mentorju... Povezava se odpre v novem oknu

.pdfPDF - Predstavitvena datoteka, prenos (1,45 MB)
MD5: BC24329610A2E987646A3E3FC284DC52

Izvleček
Diplomsko delo obravnava uporabo metod obdelave naravnega jezika za avtomatsko klasifikacijo in analizo predlogov ter komentarjev državljanov na slovenskem portalu e-participacije predlagam.vladi.si. Portal je od začetka delovanja leta 2009 zbral 19.000 predlogov in 135.000 komentarjev, ki na portalu niso avtomatsko kategorizirani ali analizirani, kar otežuje njihovo učinkovito obravnavo. V empiričnem delu je bilo testiranih več različnih pristopov in modelov na treh nalogah: tematska kategorizacija predlogov (9 razredov), čustveni ton predlogov (4 razredi) in sentiment komentarjev (3 razredi). Pripravljen je bil ročno označen vzorec 500 predlogov in 300 komentarjev, ki je bil razdeljen v razmerju 70:30 na učni in testni nabor. Na teh podatkih je bilo evalviranih 6 modelov: klasična pristopa TF-IDF + SVM in fastText, lokalna modela Llama 3.2-3B in GaMS3-12B v načinu zero-shot ter s prilagoditvijo QLoRA in komercialni model OpenAI GPT-5-mini. Slednji je pri vseh treh nalogah dosegel najboljše rezultate in je pri tematski klasifikaciji uspel pravilno označiti skoraj tri četrtine predlogov. Najbolj se mu je približal slovenski lokalni model GaMS3-12B s prilagoditvijo QLoRA, in sicer na nekaj odstotnih točk razlike. Analiza čustvenega tona je bila težavna za vse modele, najboljši rezultat je znašal F1 = 0.49. Delo prispeva k sistematičnemu pregledu uporabnosti različnih NLP metod na slovenskih javnoupravnih besedilih. Vzpostavlja ročno označen nabor podatkov in definira tri kategorizacijske sheme na pridobljeni podatkovni zbirki portala.

Jezik:Slovenski jezik
Ključne besede:javna uprava, e-participacija, obdelava naravnega jezika, veliki jezikovni modeli, predlagam.vladi.si, klasifikacija besedil, analiza sentimenta
Vrsta gradiva:Diplomsko delo/naloga
Tipologija:2.11 - Diplomsko delo
Organizacija:FU - Fakulteta za upravo
FRI - Fakulteta za računalništvo in informatiko
Kraj izida:Ljubljana
Založnik:[N. Likar]
Leto izida:2026
Št. strani:XI, 61 str.
PID:20.500.12556/RUL-183614 Povezava se odpre v novem oknu
UDK:004.8:35(497.4-054.5(043.2)
COBISS.SI-ID:282813443 Povezava se odpre v novem oknu
Datum objave v RUL:16.06.2026
Število ogledov:151
Število prenosov:115
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Sekundarni jezik

Jezik:Angleški jezik
Naslov:Analysis of the use of large language models in citizen proposals on the predlagam vladi portal
Izvleček:
The thesis examines the use of large language processing methods for automated classification and analysis of citizen proposals and comments on Slovenian e-participation portal predlagam.vladi.si. Since the site’s launch in 2009 the portal has accumulated 19 thousand proposals and 135 thousand comments, which are not being automatically categorized or analyzed, making their effective processing challenging. In the empirical part of the study there were several approaches and models evaluated across three tasks: thematic classification of proposals (9 classes), emotional tone of proposals (4 classes) and comment sentiment (3 classes). A manually labeled sample of 500 proposals and 300 comments was created and split into training and test set in a 70:30 ratio. Six models were evaluated on this data: classical TF-IDF + SVM and fastText approaches, local models Llama 3.2-3B and GaMS3-12B in zero-shot setting as well as fine-tuned with QLoRA and commercial OpenAI GPT-5-mini model. The latter achieved the best result across all three tasks, correctly classifying almost three-quarters of proposals in thematic classification task. The closest performance was achieved by Slovenian local model GaMS3-12B fine-tuned with QLoRA with only a few percentage points difference. Emotional tone classification proved challenging for all models with the best result reaching an F1 score of 0.49. This work provides a systematic overview of the applicability of different NLP methods to Slovenian public administration texts. It establishes a manually labeled dataset and defines three categorization schemes based on the collected portal data.

Ključne besede:public administration, e-participation, natural language processing, large language models, predlagam.vladi.si, text classification, sentiment analysis

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Nazaj