Podrobno

Question-answering from old sources with large language models
ID Tavchioski, Ilija (Avtor), ID Robnik Šikonja, Marko (Mentor) Več o mentorju... Povezava se odpre v novem oknu

.pdfPDF - Predstavitvena datoteka, prenos (1017,17 KB)
MD5: 2E9F10BB395F2E3A7DA5FC9A13601F55

Izvleček
With the expansion of artificial intelligence and the field of natural language processing, researchers and corporations trained their models on huge text corpora. However, a large portion of historical sources and knowledge remain underutilized due to significant differences in vocabulary, linguistic structure, and writing styles. In this work, we address historical texts and documents in less-resourced languages, focused on Slovenian. By using a digitized corpus of documents in historical Slovenian, we generated a QA (question-answering) dataset using Slovene large language model GaMS (Generative Model for Slovene). We supported our research on historical Slovenian with several methodologies such as fine-tuned large language models, PageIndex RAG (Retrieval-Augmented Generation) and a RAG approach with a hybrid retriever, expanded with different embeddings such as Sentence BERT, F2LLM and our own fine-tuned model. The results show that the GaMS3 model is the most suited for generating a good QA dataset from historical data and is the best performing model for question answering, while the hybrid retriever enhanced with embeddings calculated from our own finetuned model was best suited for retrieval tasks.

Jezik:Angleški jezik
Ključne besede:Natural Language Processing, Historical language, Machine Learning, Large Language Models, Question Answering
Vrsta gradiva:Magistrsko delo/naloga
Tipologija:2.09 - Magistrsko delo
Organizacija:FRI - Fakulteta za računalništvo in informatiko
Leto izida:2026
PID:20.500.12556/RUL-182246 Povezava se odpre v novem oknu
COBISS.SI-ID:277475587 Povezava se odpre v novem oknu
Datum objave v RUL:05.05.2026
Število ogledov:294
Število prenosov:175
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Sekundarni jezik

Jezik:Slovenski jezik
Naslov:Odgovarjanje na vprašanja iz starih virov z velikimi jezikovnimi modeli
Izvleček:
Z razmahom umetne inteligence in področja obdelave naravnega jezika so modeli naučeni na ogromnih zbirkah besedil. Vendar pa velik del zgodovinskih virov in znanja ostaja neizkoriščen zaradi pomembnih razlik v besedišču, jezikovni strukturi in slogu pisanja. V tem delu obravnavamo zgodovinska besedila in dokumente v manj razvitih jezikih, s poudarkom na slovenščini. Z uporabo digitaliziranega korpusa dokumentov v zgodovinski slovenščini smo generirali podatkovno množico vprašanj in odgovorov z uporabo GaMS (Generativni Model Slovenščine). Našo raziskavo zgodovinske slovenščine smo podprli z več metodologijami, kot so prilagojeni veliki jezikovni modeli, PageIndex RAG (Retrieval-Augmented Generation) ter pristop RAG z uporabo hibridnega iskalnika, razširjenega z različnimi vektorskimi vložitvami, kot so Sentence BERT, F2LLM in naš lastni prilagojen model. Rezultati so pokazali, da je model GaMS3 najprimernejši za generiranje kakovostne množico vprašanj in odgovorov iz zgodovinskih podatkov ter najboljši za odgovarjanje na vprašanja, medtem ko je hibridni iskalnik, nadgrajen z vektorskimi vložitvami, izračunanimi z lastnim prilagojenim modelom, najprimernejši za naloge iskanja.

Ključne besede:obdelava naravnega jezika, zgodovinski jezik, strojno učenje, veliki jezikovni modeli, odgovarjanje na vprašanja

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Nazaj