Details

Anonimiziranje imenovanih entitet v uradnih dokumentih z uporabo strojnega učenja : diplomsko delo
ID Rajič, Loti (Author), ID Dečman, Mitja (Mentor) More about this mentor... This link opens in a new window

.pdfPDF - Presentation file, Download (1,49 MB)
MD5: 365219C4E96EDDCA807E732250AB7B2E

Abstract
Napredek na področju strojnega učenja in obdelave naravnega jezika je omogočil razvoj naprednih metod za obdelavo besedilnih podatkov, med katerimi ima pomembno vlogo tudi avtomatska anonimizacija dokumentov. V javni upravi se pogosto pojavlja potreba po objavi ali posredovanju dokumentov, ki vsebujejo osebne podatke, zato je njihova ustrezna zaščita ključnega pomena. Anonimizacija omogoča odstranitev ali preoblikovanje občutljivih informacij, pri čemer se ohrani uporabnost dokumenta za nadaljnjo obdelavo ali analizo. Diplomsko delo obravnava problem anonimizacije imenovanih entitet v uradnih dokumentih s pomočjo metod strojnega učenja. Namen raziskave je bil razviti in preizkusiti model za prepoznavanje imenovanih entitet v slovenskih besedilih ter na podlagi zaznanih entitet izvesti njihovo avtomatsko anonimizacijo. V okviru raziskave je bil uporabljen pristop prepoznavanja imenovanih entitet (NER), implementiran z uporabo knjižnice spaCy in dodatno prilagojen za slovenski jezik. Model je bil naučen na označenem korpusu besedil, ki vsebuje primere osebnih imen, organizacij in lokacij. V praktičnem delu je bil razvit tudi prototip aplikacije za anonimizacijo dokumentov, ki omogoča nalaganje besedil, samodejno prepoznavanje občutljivih podatkov ter njihovo nadomestitev z anonimiziranimi oznakami. Učinkovitost modela je bila ocenjena z uporabo standardnih metrik za vrednotenje modelov strojnega učenja, kot so natančnost (precision), priklic (recall) in mera F1. Rezultati raziskave kažejo, da lahko pristopi strojnega učenja učinkovito podpirajo proces anonimizacije besedilnih dokumentov, hkrati pa ohranjajo razumljivost in strukturo besedila. Razvita rešitev predstavlja osnovo za nadaljnji razvoj orodij za avtomatsko anonimizacijo dokumentov v javni upravi in drugih organizacijah, kjer je varstvo osebnih podatkov ključnega pomena.

Language:Slovenian
Keywords:anonimizacija, imenovane entitete, strojno učenje, obdelava naravnega jezika, varstvo osebnih podatkov
Work type:Bachelor thesis/paper
Typology:2.11 - Undergraduate Thesis
Organization:FU - Faculty of Administration
FRI - Faculty of Computer and Information Science
Place of publishing:Ljubljana
Publisher:[L. Rajič]
Year:2026
Number of pages:XI, 49 str.
PID:20.500.12556/RUL-182060 This link opens in a new window
Publication date in RUL:23.04.2026
Views:250
Downloads:139
Metadata:XML DC-XML DC-RDF
:
Copy citation
Share:Bookmark and Share

Secondary language

Language:English
Title:Anonymization of named entities in official documents using machine learning
Abstract:
Advances in machine learning and natural language processing have enabled the development of advanced methods for processing textual data, including automated document anonymization. In public administration, documents that contain personal data are frequently shared or published, making the protection of sensitive information essential. Anonymization allows the removal or transformation of sensitive data while preserving the usability and structure of the document. This thesis addresses the problem of anonymizing named entities in official documents using machine learning techniques. The aim of the research was to develop and evaluate a model capable of recognizing named entities in Slovenian texts and automatically anonymizing them. The research was based on the named entity recognition (NER) approach implemented using the spaCy library and adapted for the Slovenian language. The model was trained on an annotated corpus containing examples of personal names, organizations, and locations. In the practical part of the thesis, a prototype application for document anonymization was developed. The application allows users to upload text documents, automatically detect sensitive entities, and replace them with anonymized labels. The performance of the model was evaluated using standard machine learning evaluation metrics, including precision, recall, and F1-score. The results indicate that machine learning approaches can effectively support the anonymization of textual documents while preserving their readability and structural integrity. The developed solution provides a foundation for further development of automated anonymization tools that could be applied in public administration and other environments where personal data protection is essential.

Keywords:anonymization, named entity recognition, machine learning, natural language processing, personal data protection

Similar documents

Similar works from RUL:
Similar works from other Slovenian collections:

Back