Podrobno

Strojno prepoznavanje čustev v slovenščini
ID MARTINŠEK, MARCEL FRANSE (Avtor), ID Robnik Šikonja, Marko (Mentor) Več o mentorju... Povezava se odpre v novem oknu

.pdfPDF - Predstavitvena datoteka, prenos (2,35 MB)

Izvleček
Izražanje čustev je pomemben del komunikacije med ljudmi, zato se je razvoj njihove strojne prepoznave v zadnjih letih pospešil. Informacije o čustvih lahko uporabimo na področjih oglaševanja, psihologije, interakcije med ljudmi in roboti ipd. Za slovenščino modela za strojno prepoznavo čustev iz besedil še ni, zato smo ga razvili z uporabo sodobnih metod obdelave naravnega jezika. Zaradi neobstoječe zbirke označenih besedil v slovenščini smo uporabili medjezikovni prenos in za treniranje izkoristili zbirko v angleščini in trojezični model CroSloEngual BERT. Za testiranje modela smo ustvarili zbirko SloReddit ($162$ komentarjev). Z medjezikovnim prenosom brez dodatnih primerov smo na njej dosegli makro $F_1$ $0{,}657$. S prilagajanjem istega modela na približno stotih primerih iz te zbirke se ocena v navzkrižnem preverjanju dvigne na $0{,}674$, kar je primerljivo z ocenami podobnih modelov za strojno prepoznavo čustev v angleških besedilih. Pokazali smo, da že približno sto ročno označenih izvornih primerov prispeva več kot obsežno prilagajanje na tisočih prevedenih primerih. Primerjali smo še enojezični SloBERTa, skupino binarnih modelov in ukazne pozive z modeli GaMS. Noben izmed dodatnih pristopov na izvornih komentarjih ni presegel prilagojenega modela CSE-BERT.

Jezik:Slovenski jezik
Ključne besede:napovedovanje čustev, klasifikacija iz besedil, prenos znanja, obdelava naravnega jezika, model BERT, model CroSloEngual BERT, model GaMS
Vrsta gradiva:Diplomsko delo/naloga
Organizacija:FRI - Fakulteta za računalništvo in informatiko
Leto izida:2026
Datum objave v RUL:15.09.2026
Število ogledov:6
Število prenosov:0
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Sekundarni jezik

Jezik:Angleški jezik
Naslov:Machine emotion detection in Slovene
Izvleček:
Expressing emotions is an important part of human communication, which is why development of automatic emotion detection has accelerated in recent years. Emotion information is useful in advertising, psychology, human–robot interaction, and related areas. No model for emotion detection from Slovene text was available, so we developed one using modern natural language processing methods. As no annotated Slovene training set exists, we relied on cross-lingual transfer, training the trilingual CroSloEngual BERT model on an English corpus. For evaluation, we created the SloReddit dataset ($162$ comments). With zero-shot cross-lingual transfer we obtained the macro $F_1$ score of $0.657$ on this set. Fine-tuning the same model on roughly one hundred examples from it raises the score to $0.674$ using cross-validation, which is comparable to similar emotion recognition models for English text. We show that roughly one hundred manually labelled native examples contribute more than fine-tuning on thousands of translated ones. We also compared monolingual SloBERTa, an ensemble of binary classifiers, and prompting of GaMS models. None of these additional approaches surpassed fine-tuned CSE-BERT on native comments.

Ključne besede:emotion detection, text classification, zero-shot transfer, natural language processing, BERT model, CroSloEngual BERT model, GaMS model

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Nazaj