Details

Strojno prepoznavanje čustev v slovenščini
ID MARTINŠEK, MARCEL FRANSE (Author), ID Robnik Šikonja, Marko (Mentor) More about this mentor... This link opens in a new window

.pdfPDF - Presentation file, Download (2,35 MB)
MD5: 556C1B47DAD6A90400FD8E1ABB09368A

Abstract
Izražanje čustev je pomemben del komunikacije med ljudmi, zato se je razvoj njihove strojne prepoznave v zadnjih letih pospešil. Informacije o čustvih lahko uporabimo na področjih oglaševanja, psihologije, interakcije med ljudmi in roboti ipd. Za slovenščino modela za strojno prepoznavo čustev iz besedil še ni, zato smo ga razvili z uporabo sodobnih metod obdelave naravnega jezika. Zaradi neobstoječe zbirke označenih besedil v slovenščini smo uporabili medjezikovni prenos in za treniranje izkoristili zbirko v angleščini in trojezični model CroSloEngual BERT. Za testiranje modela smo ustvarili zbirko SloReddit ($162$ komentarjev). Z medjezikovnim prenosom brez dodatnih primerov smo na njej dosegli makro $F_1$ $0{,}657$. S prilagajanjem istega modela na približno stotih primerih iz te zbirke se ocena v navzkrižnem preverjanju dvigne na $0{,}674$, kar je primerljivo z ocenami podobnih modelov za strojno prepoznavo čustev v angleških besedilih. Pokazali smo, da že približno sto ročno označenih izvornih primerov prispeva več kot obsežno prilagajanje na tisočih prevedenih primerih. Primerjali smo še enojezični SloBERTa, skupino binarnih modelov in ukazne pozive z modeli GaMS. Noben izmed dodatnih pristopov na izvornih komentarjih ni presegel prilagojenega modela CSE-BERT.

Language:Slovenian
Keywords:napovedovanje čustev, klasifikacija iz besedil, prenos znanja, obdelava naravnega jezika, model BERT, model CroSloEngual BERT, model GaMS
Work type:Bachelor thesis/paper
Organization:FRI - Faculty of Computer and Information Science
Year:2026
PID:20.500.12556/RUL-187851 This link opens in a new window
Publication date in RUL:15.09.2026
Views:18
Downloads:0
Metadata:XML DC-XML DC-RDF
:
Copy citation
Share:Bookmark and Share

Secondary language

Language:English
Title:Machine emotion detection in Slovene
Abstract:
Expressing emotions is an important part of human communication, which is why development of automatic emotion detection has accelerated in recent years. Emotion information is useful in advertising, psychology, human–robot interaction, and related areas. No model for emotion detection from Slovene text was available, so we developed one using modern natural language processing methods. As no annotated Slovene training set exists, we relied on cross-lingual transfer, training the trilingual CroSloEngual BERT model on an English corpus. For evaluation, we created the SloReddit dataset ($162$ comments). With zero-shot cross-lingual transfer we obtained the macro $F_1$ score of $0.657$ on this set. Fine-tuning the same model on roughly one hundred examples from it raises the score to $0.674$ using cross-validation, which is comparable to similar emotion recognition models for English text. We show that roughly one hundred manually labelled native examples contribute more than fine-tuning on thousands of translated ones. We also compared monolingual SloBERTa, an ensemble of binary classifiers, and prompting of GaMS models. None of these additional approaches surpassed fine-tuned CSE-BERT on native comments.

Keywords:emotion detection, text classification, zero-shot transfer, natural language processing, BERT model, CroSloEngual BERT model, GaMS model

Similar documents

Similar works from RUL:
Similar works from other Slovenian collections:

Back