Prispevek obravnava izzive in pristope k zaznavanju protislovij v pravnih besedilih v slovenskem jeziku. Protislovja v zakonodaji in sodni praksi predstavljajo resen problem za pravno varnost, konsistentnost in interpretacijo prava.
Vzpostavitev sistema, ki bi avtomatsko prepoznaval vsebinska neskladja, zato predstavlja pomemben korak k učinkovitejši pravni analizi in razvoju naprednih pravnih informacijskih sistemov in kvalitetnejši pravni nomotehniki.
V ta namen pripravimo največji javno dostopen korpus slovenskega pravnega jezika, ki obsega več kot 1 milijardo besednih enot. Korpus zajema slovensko zakonodajo, odločbe Ustavnega sodišča RS in vse javno dostopne odločbe rednih sodišč, ter nekatere druge pravne akte objavljene v Uradnem listu Republike Slovenije (od osamosvojitve RS dalje), pridobljene iz javnih virov z uporabo programskih vmesnikov (API-jev) in spletnih pajkov. Korpus je skrbno očiščen, strukturiran in vsebuje metapodatke, kar omogoča uporabo
pri različnih nalogah s področja obdelave naravnega jezika.
Na osnovi korpusa smo pripravili model PravniBERT, na podlagi arhitekture ModernBERT, ki je optimizirana za dolge zapise. Model smo evalvirali z nalogo iskanja člena, ki je danemu tekstu vsebinsko protisloven. Naš model je pri nalogi iskanja ustreznih členov dosegel natančnost 83,6 % pri najboljših treh rezultatih (accuracy@3). Nadaljnje delo vključuje dodaten razvoj modela, razširitev korpusa in priprava ročno anotiranih učnih podatkov na širšem naboru zakonikov.
Prispevek tako ponuja metodološke in tehnične temelje za nadaljnji razvoj sistemov za avtomatsko zaznavanje kontradikcij v pravnem jeziku. Predstavlja tudi pomemben prispevek k razvoju jezikovnih virov in umetne inteligence v slovenskem pravnem prostoru.
|