Podrobno

Zaznavanje ljudskih pripovedi v zgodovinskih časopisih z uporabo velikih jezikovnih modelov
ID Rejec, Jurij (Avtor), ID Robnik Šikonja, Marko (Mentor) Več o mentorju... Povezava se odpre v novem oknu, ID El Haff, Karim (Komentor)

.pdfPDF - Predstavitvena datoteka, prenos (766,77 KB)
MD5: 081474FF006422C7900D0768D3BB72B3

Izvleček
Ljudske pripovedi so v zgodovinskih časopisih razpršene in praviloma neoznačene, zato je njihovo samodejno prepoznavanje zahtevna naloga klasifikacije besedil. V nalogi se osredotočamo na zaznavanje ljudskih pripovedi v časopisu Kmetijske in rokodelske novice z uporabo velikih jezikovnih modelov. Zlati standard obsega 2.860 člankov, pri čemer je bilo na podlagi uporabljenih klasifikacijskih meril 29 člankov uvrščenih v pozitivni razred ljudskih pripovedi. Primerjamo dva komercialna in šest odprtih lokalnih modelov s tremi različicami poziva. Najuspešnejši komercialni model doseže vrednost Matthewsovega korelacijskega koeficienta (MCC) 0,923, najboljši neprilagojeni odprti lokalni model pa MCC 0,810. Oba pri tem dosegata popoln priklic. Z destilacijo znanja, prilagoditvijo z matrikami nizkega ranga (LoRA) in kvantizirano prilagoditvijo z matrikami nizkega ranga (QLoRA) prenesemo sodbe in utemeljitve komercialnega učiteljskega modela na dva odprta lokalna modela. Vsi adapterji presežejo pripadajoče izhodiščne modele, najvišji MCC lokalnih modelov pa se poveča na 0,861. Popoln priklic najboljših modelov na tem vzorcu kaže na njihov potencial pri predhodnem izboru kandidatov, napačne pozitivne napovedi pa še vedno zahtevajo strokovno preverjanje.

Jezik:Slovenski jezik
Ključne besede:veliki jezikovni modeli, QLoRA, zgodovinski časopisi, ljudske pripovedi, digitalna humanistika, klasifikacija besedil
Vrsta gradiva:Diplomsko delo/naloga
Organizacija:FRI - Fakulteta za računalništvo in informatiko
Leto izida:2026
PID:20.500.12556/RUL-187809 Povezava se odpre v novem oknu
Datum objave v RUL:14.09.2026
Število ogledov:10
Število prenosov:2
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Sekundarni jezik

Jezik:Angleški jezik
Naslov:Detecting folktales in historical newspapers using large language models
Izvleček:
Folktales are scattered across historical newspapers and generally unlabelled, making their automatic identification a challenging text classification task. This thesis examines the automatic detection of folktales in the newspaper Kmetijske in rokodelske novice using large language models. The gold-standard dataset comprises 2,860 articles, 29 of which themselves narrate a folktale under the adopted criteria. We compare two commercial and six open-weight local models using three prompt variants. The best commercial model achieves a Matthews correlation coefficient (MCC) of 0.923, while the best unadapted open-weight local model achieves 0.810. Both attain perfect recall. Using knowledge distillation, low-rank adaptation (LoRA), and quantized low-rank adaptation (QLoRA), we transfer the commercial teacher model's judgments and rationales to two open-weight local models. All adapters outperform their corresponding base models, raising the best local MCC to 0.861. The perfect recall achieved by the best models on this sample suggests their potential for preliminary candidate selection, while false-positive predictions still require expert verification.

Ključne besede:large language models, QLoRA, historical newspapers, folktales, digital humanities, text classification

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Nazaj