Details

Optično prepoznavanje cirilskih znakov s pomočjo vizualno-jezikovnih modelov
ID Ivanović, Sandra (Author), ID Kavčič, Alenka (Mentor) More about this mentor... This link opens in a new window

.pdfPDF - Presentation file, Download (3,04 MB)
MD5: 6C1E9C6F31FBA2299DD8388E6A4859E7

Abstract
Naloga se osredotoča na izboljšanje prepoznave besedila v zbirki zapisnikov yu1Parl, ki vsebuje zapisnike parlamentarnih sej Narodnega predstavništva Kraljevine SHS oziroma Jugoslavije iz obdobja 1919-1939. Ti dokumenti so zapisani v srbohrvaščini in slovenščini, pri čemer srbohrvaščina uporablja dve pisavi, latinico in cirilico, kar predstavlja dodaten izziv za optično prepoznavo znakov. Optično prepoznavo cirilskih znakov smo poskušali izboljšati s pomočjo dveh vizualno-jezikovnih modelov, GOT in SmolDocling. Za potrebe dodatnega učenja modelov je bila ustvarjena množica približno 20.000 sintetičnih slik, ki je služila kot učna množica za izboljšanje zmogljivosti modelov na zgodovinskih dokumentih. Rezultati so pokazali, da dodatno učenje vizualno-jezikovnih modelov na sintetičnih podatkih sicer izboljša uspešnost optične prepoznave cirilskih znakov, vendar na realnih dokumentih iz korpusa yu1Parl tudi prilagojeni modeli še vedno ne dosegajo zadostne stopnje zanesljivosti za praktično uporabo.

Language:Slovenian
Keywords:optično prepoznavanje znakov, vizualno-jezikovni modeli, zgodovinski dokumenti
Work type:Bachelor thesis/paper
Typology:2.11 - Undergraduate Thesis
Organization:FRI - Faculty of Computer and Information Science
Year:2026
PID:20.500.12556/RUL-180734 This link opens in a new window
COBISS.SI-ID:275390979 This link opens in a new window
Publication date in RUL:16.03.2026
Views:248
Downloads:114
Metadata:XML DC-XML DC-RDF
:
Copy citation
Share:Bookmark and Share

Secondary language

Language:English
Title:Optical character recognition of Cyrillic characters using Vision-Language Models
Abstract:
The thesis focuses on improving text recognition in the yu1Parl collection, which contains transcripts of parliamentary sessions of the National Assembly of the Kingdom of Serbs, Croats and Slovenes (SHS), later Yugoslavia, from the period 1919–1939. These documents are written in Serbo-Croatian and Slovenian, with Serbo-Croatian using two scripts, Latin and Cyrillic, which presents an additional challenge for optical character recognition. We attempted to improve the recognition of Cyrillic characters using two vision-language models, GOT and SmolDocling. For the purpose of fine-tuning the models, a dataset of approximately 20,000 synthetic images was created and used as a training set to enhance model performance on historical documents. The results showed that additional training of vision–language models on synthetic data improves the performance of optical recognition of Cyrillic characters. However, on real documents from the yu1Parl corpus, even the adapted models still do not achieve a sufficient level of reliability for practical use.

Keywords:optical character recognition, vision-language models, historical documents

Similar documents

Similar works from RUL:
Similar works from other Slovenian collections:

Back