Podrobno

Towards contradiction detection in legal texts : corpus preparation and contradiction extraction
ID Malenšek, Miha (Avtor), ID Završnik, Aleš (Avtor), ID Krajnc, Saša (Avtor), ID Križnar, Primož (Avtor), ID Bajec, Marko (Avtor), ID Žitnik, Slavko (Avtor)

.pdfPDF - Predstavitvena datoteka, prenos (364,55 KB)
MD5: 21A31BF51923D233E16A88CCA9B10C12
URLURL - Izvorni URL, za dostop obiščite https://journals.uni-lj.si/slovenscina2/article/view/22317 Povezava se odpre v novem oknu

Izvleček
This paper lays the foundation for using Large Language Models (LLMs) in the Slovenian legal domain. We address data scarcity in low-resource languages by constructing the largest publicly available Slovene Legal Corpus, spanning over one billion tokens from legislative, judicial, and governmental texts. We introduce PravniBERT, a domain-specific Slovene legal language model, and evaluate it on contradiction-based legal article retrieval, achieving 83.6% ac-curacy@3. Our results demonstrate the feasibility of applying LLMs to complex legal reasoning in under-resourced settings and highlight the potential for transparent, domain-adapted legal AI in Slovenia.

Jezik:Angleški jezik
Ključne besede:legal NLP, Slovene Legal Corpus, contradiction detection, large language models
Vrsta gradiva:Članek v reviji
Tipologija:1.01 - Izvirni znanstveni članek
Organizacija:FRI - Fakulteta za računalništvo in informatiko
FF - Filozofska fakulteta
Status publikacije:Objavljeno
Različica publikacije:Objavljena publikacija
Leto izida:2025
Št. strani:str. 179-209
Številčenje:Letn. 13, št. 2
PID:20.500.12556/RUL-179012 Povezava se odpre v novem oknu
UDK:004.89:81'322.2:34
ISSN pri članku:2335-2736
DOI:10.4312/slo2.0.2025.2.179-209 Povezava se odpre v novem oknu
COBISS.SI-ID:266721539 Povezava se odpre v novem oknu
Datum objave v RUL:03.02.2026
Število ogledov:567
Število prenosov:296
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Gradivo je del revije

Naslov:Slovenščina 2.0 : empirične, aplikativne in interdisciplinarne raziskave
Založnik:Trojina, zavod za uporabno slovenistiko, Trojina, zavod za uporabno slovenistiko, Trojina, zavod za uporabno slovenistiko, Znanstvena založba Filozofske fakultete, Znanstvena založba Filozofske fakultete, Založba Univerze v Ljubljani
ISSN:2335-2736
COBISS.SI-ID:264547328 Povezava se odpre v novem oknu

Licence

Licenca:CC BY-SA 4.0, Creative Commons Priznanje avtorstva-Deljenje pod enakimi pogoji 4.0 Mednarodna
Povezava:http://creativecommons.org/licenses/by-sa/4.0/deed.sl
Opis:Ta licenca Creative Commons je zelo podobna običajni licenci Priznanje avtorstva, vendar zahteva, da so materialne avtorske pravice na izpeljanih delih upravljane z enako licenco.

Sekundarni jezik

Jezik:Slovenski jezik
Naslov:Zaznava protislovij v pravnih besedilih
Izvleček:
Prispevek obravnava izzive in pristope k zaznavanju protislovij v pravnih besedilih v slovenskem jeziku. Protislovja v zakonodaji in sodni praksi predstavljajo resen problem za pravno varnost, konsistentnost in interpretacijo prava. Vzpostavitev sistema, ki bi avtomatsko prepoznaval vsebinska neskladja, zato predstavlja pomemben korak k učinkovitejši pravni analizi in razvoju naprednih pravnih informacijskih sistemov in kvalitetnejši pravni nomotehniki. V ta namen pripravimo največji javno dostopen korpus slovenskega pravnega jezika, ki obsega več kot 1 milijardo besednih enot. Korpus zajema slovensko zakonodajo, odločbe Ustavnega sodišča RS in vse javno dostopne odločbe rednih sodišč, ter nekatere druge pravne akte objavljene v Uradnem listu Republike Slovenije (od osamosvojitve RS dalje), pridobljene iz javnih virov z uporabo programskih vmesnikov (API-jev) in spletnih pajkov. Korpus je skrbno očiščen, strukturiran in vsebuje metapodatke, kar omogoča uporabo pri različnih nalogah s področja obdelave naravnega jezika. Na osnovi korpusa smo pripravili model PravniBERT, na podlagi arhitekture ModernBERT, ki je optimizirana za dolge zapise. Model smo evalvirali z nalogo iskanja člena, ki je danemu tekstu vsebinsko protisloven. Naš model je pri nalogi iskanja ustreznih členov dosegel natančnost 83,6 % pri najboljših treh rezultatih (accuracy@3). Nadaljnje delo vključuje dodaten razvoj modela, razširitev korpusa in priprava ročno anotiranih učnih podatkov na širšem naboru zakonikov. Prispevek tako ponuja metodološke in tehnične temelje za nadaljnji razvoj sistemov za avtomatsko zaznavanje kontradikcij v pravnem jeziku. Predstavlja tudi pomemben prispevek k razvoju jezikovnih virov in umetne inteligence v slovenskem pravnem prostoru.

Ključne besede:pravni NLP, zaznava protislovij, veliki jezikovni modeli

Projekti

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:GC-0002
Naslov:Veliki jezikovni modeli za digitalno humanistiko

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:J7-4642-2022
Naslov:Temeljne raziskave za razvoj govornih virov in tehnologij za slovenščino

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Zbirka

To gradivo je del naslednjih zbirk del:
  1. Slovenščina 2.0

Nazaj