Details

Pridobivanje dogodkov iz besedilnih korpusov z malo viri
ID Leban, Mitja (Author), ID Bohak, Ciril (Mentor) More about this mentor... This link opens in a new window, ID Šmajdek, Uroš (Comentor)

.pdfPDF - Presentation file, Download (379,53 KB)
MD5: F769D898EA4510340EAB6B4A0FC0415A

Abstract
Ekstrakcija dogodkov je naloga obdelave naravnega jezika, katere cilj je iz nestrukturiranih besedil sistematično izluščiti strukturirane informacije o do godkih, vključno z njihovimi prožilci, udeleženci, časovnim okvirom in lokacijo. Večina obstoječih pristopov in označenih podatkovnih zbirk je omejena na angleški jezik, kar otežuje razvoj in ovrednotenje modelov za druge jezike. V tej diplomski nalogi obravnavamo ekstrakcijo dogodkov v slovenskem jeziku z dvema pristopoma. Najprej preizkusimo pozivanje brez predhodnih prime rov na več javno dostopnih velikih jezikovnih modelih različnih velikosti in ponudnikov. Nato modele dodatno prilagodimo z metodo nizkorangovne prila goditve (LoRA) in primerjamo rezultate pred in po prilagajanju. Podatkovne zbirke WIKIEVENTS, CASIE in ROBUST prevedemo v slovenščino z mode lom za strojno prevajanje NLLB-200 ter na prevedenih različicah izvedemo sklepanje. Kot referenčni model uporabimo InstructUIE in ADELIE-DPO. Rezultati kažejo, da veliki jezikovni modeli kljub doučevanju zaostajajo za modeli, specializiranimi za ekstrakcijo dogodkov. Slednji dosegajo višje rezul tate na podatkovnih zbirkah v svojem izvornem jeziku, vendar pri slovenščini beležijo bistveno večji upad učinkovitosti.

Language:Slovenian
Keywords:ekstrakcija dogodkov, jeziki z malo viri, veliki jezikovni modeli.
Work type:Bachelor thesis/paper
Typology:2.11 - Undergraduate Thesis
Organization:FRI - Faculty of Computer and Information Science
Year:2026
PID:20.500.12556/RUL-184823 This link opens in a new window
COBISS.SI-ID:286391555 This link opens in a new window
Publication date in RUL:15.07.2026
Views:220
Downloads:73
Metadata:XML DC-XML DC-RDF
:
Copy citation
Share:Bookmark and Share

Secondary language

Language:English
Title:Event extraction from text corpora for low resource languages
Abstract:
Event extraction is a natural language processing task aimed at systemati cally identifying structured information about events from unstructured text, including triggers, participants, temporal context, and location. Most existing approaches and annotated datasets are limited to English, hindering the development and evaluation of models for other languages. In this thesis, we address event extraction in Slovenian using two approaches. We first evaluate zero-shot prompting across several publicly available large language models of varying sizes and providers. We then fine-tune the models using Low-Rank Adaptation (LoRA) and compare performance before and after adaptation. The WIKIEVENTS, CASIE, and ROBUST datasets are translated into Slovenian using the NLLB-200 machine translation model, and inference is performed on the translated versions. InstructUIE and ADELIE-DPO serve as reference models. The results show that large language models, despite fine-tuning, fall short of models specialized for event extraction. The latter achieve higher results on datasets in their native language, however they exhibit a substantially larger drop in performance when applied to Slovenian.

Keywords:event extraction, low-resource languages, large language models.

Similar documents

Similar works from RUL:
Similar works from other Slovenian collections:

Back