Podrobno

Ocenjevanje kakovosti slik poslovnih dokumentov z globokim učenjem na podlagi lokalnih regij
ID Krivec, Jan (Avtor), ID Skočaj, Danijel (Mentor) Več o mentorju... Povezava se odpre v novem oknu

.pdfPDF - Predstavitvena datoteka, prenos (13,08 MB)
MD5: 9BDF4B807DAA9757132AB18FE55BF504

Izvleček
Sistemi za optično prepoznavo znakov so občutljivi na kakovost vhodnih slik, nepravilna prepoznava pa pomeni napake v nadaljnji obdelavi. Obstoječi pristopi k ocenjevanju kakovosti dokument opišejo z eno samo oceno, ki ne pove niti kje na dokumentu so napake, niti ali so pomembni deli dokumenta okrnjeni. V delu predstavimo lokalizirano ocenjevanje kakovosti slik poslovnih dokumentov. Zgradimo sintetično množico 2299 računov, ki vsebuje oznake semantičnih regij dokumenta in v kateri je napaka strojnega branja izmerjena za vsako besedo posebej ter na njej naučimo enotni večopravilni model s skupnim kodirnikom, ki iz vhodne slike hkrati napove sliko intenzivnosti napake in segmentacijo pomenskih regij. Model na prej nevidenih predlogah dosega dokumentni SROCC 0,91, pri odločanju o sprejemljivosti dokumenta glede na pomembne regije pa preseže tudi teoretično zgornjo mejo vseh ocen na ravni celotne strani (AUC 0,92 proti 0,76). S poskusi na referenčni množici SmartDoc-QA pokažemo, da je tudi pri napovedi ene povprečne ocene kakovosti strani pomemben lokaliziran učni signal in ne samo arhitektura modela.

Jezik:Slovenski jezik
Ključne besede:optična prepoznava znakov, strojno učenje, globoko učenje, globoke nevronske mreže
Vrsta gradiva:Magistrsko delo/naloga
Organizacija:FRI - Fakulteta za računalništvo in informatiko
Leto izida:2026
PID:20.500.12556/RUL-189099 Povezava se odpre v novem oknu
Datum objave v RUL:01.10.2026
Število ogledov:15
Število prenosov:4
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Sekundarni jezik

Jezik:Angleški jezik
Naslov:Business document image quality assessment with deep learning based on local regions
Izvleček:
Optical character recognition systems are sensitive to the quality of input images and recognition errors propagate to downstream processes. Existing quality assessment approaches describe the document with a single score that reveals neither where the errors occur nor whether they affect its important parts. This thesis presents a localised quality assessment for business document images. We build a synthetic dataset of 2299 invoices, annotate the recognition error for every individual word and train a unified model with a shared encoder that predicts both the recognition error heatmap and a segmentation mask of semantic regions for the document. The model reaches a document-level SROCC of 0.91 on previously unseen templates and surpasses even the theoretical upper bound of any page-level score when classifying document acceptability based on semantically important regions (AUC 0.92 vs. 0.76). Experiments on the SmartDoc-QA dataset show that even approaches directed at page-level quality score benefit from a localised training signal.

Ključne besede:optical character recognition, machine learning, deep learning, deep neural networks

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Nazaj