Podrobno

Universal Dependencies za slovenščino : nove smernice, ročno označeni podatki in razčlenjevalni model
ID Dobrovoljc, Kaja (Avtor), ID Terčon, Luka (Avtor), ID Ljubešić, Nikola (Avtor)

.pdfPDF - Predstavitvena datoteka, prenos (517,92 KB)
MD5: 44E1790F2FA1FDA6AAF46BE71BCBE520
URLURL - Izvorni URL, za dostop obiščite https://journals.uni-lj.si/slovenscina2/article/view/12031/13792 Povezava se odpre v novem oknu

Izvleček
Universal Dependencies (UD) je mednarodno usklajena označevalna shema za medjezikovno primerljivo oblikoslovno in skladenjsko označevanje besedil po načelih odvisnostne slovnice, ki je bila ob več kot 130 drugih svetovnih jezikih uspešno uporabljena tudi za označevanje besedil v slovenščini. V prispevku predstavimo rezultate nedavnih aktivnosti v povezavi s shemo UD znotraj projekta Razvoj slovenščine v digitalnem okolju, v okviru katerega smo obstoječo infrastrukturo nadgradili s prenovo in podrobno dokumentacijo označevalnih smernic UD za slovenščino, razširitvijo drevesnice SSJ-UD za pisno slovenščino z novimi povedmi iz korpusov ssj500k in ELEXIS-WSD, izdelavo testne množice iz besedil korpusa SentiCoref za spletni portal SloBENCH ter polavtomatsko pretvorbo oblikoslovnih oznak referenčnih učnih korpusov SUK in Janes-Tag. Na razširjeni drevesnici SSJ-UD je bil naučen tudi novi napovedni model za skladenjsko razčlenjevanje v orodju CLASSLA-Stanza, ki ga v prispevku v podporo nadaljnjim jezikoslovnim aplikacijam podrobneje ovrednotimo z vidika splošne natančnosti razčlenjevanja in najpogostejših tipov napak.

Jezik:Slovenski jezik
Ključne besede:slovnično označeni korpusi, odvisnostna slovnica, drevesnica, skladenjsko razčlenjevanje, računalniško jezikoslovje, obdelava naravnega jezika (računalništvo)
Tipologija:1.01 - Izvirni znanstveni članek
Organizacija:FF - Filozofska fakulteta
Različica publikacije:Objavljena publikacija
Datum objave:01.01.2023
Leto izida:2023
Št. strani:Str. 218-246
Številčenje:Letn. 11, št. 1
PID:20.500.12556/RUL-166876 Povezava se odpre v novem oknu
UDK:004.9:81
ISSN pri članku:2335-2736
DOI:10.4312/slo2.0.2023.1.218-246 Povezava se odpre v novem oknu
COBISS.SI-ID:173830147 Povezava se odpre v novem oknu
Datum objave v RUL:29.01.2025
Število ogledov:593
Število prenosov:221
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Gradivo je del revije

Naslov:Slovenščina 2.0 : empirične, aplikativne in interdisciplinarne raziskave
Založnik:Trojina, zavod za uporabno slovenistiko, Trojina, zavod za uporabno slovenistiko, Trojina, zavod za uporabno slovenistiko, Znanstvena založba Filozofske fakultete, Znanstvena založba Filozofske fakultete, Založba Univerze v Ljubljani
ISSN:2335-2736
COBISS.SI-ID:264547328 Povezava se odpre v novem oknu

Licence

Licenca:CC BY-SA 4.0, Creative Commons Priznanje avtorstva-Deljenje pod enakimi pogoji 4.0 Mednarodna
Povezava:http://creativecommons.org/licenses/by-sa/4.0/deed.sl
Opis:Ta licenca Creative Commons je zelo podobna običajni licenci Priznanje avtorstva, vendar zahteva, da so materialne avtorske pravice na izpeljanih delih upravljane z enako licenco.

Sekundarni jezik

Jezik:Angleški jezik
Naslov:Universal dependencies for Slovenian
Izvleček:
Universal Dependencies (UD) is an internationally coordinated annotation scheme for cross-linguistically comparable morphosyntactic annotation of corpora, which has been applied to more than 130 other languages world-wide, including Slovenian. In this paper, we present the results of recent ac-tivities related to Slovenian UD annotation within the Development of Slovene in a Digital Environment project. During the project, we upgraded the existing infrastructure with reviewed and detailed documentation of the Slovenian UD annotation guidelines and produced four new datasets, manually annotated in accordance with the scheme. Specifically, we expanded the SSJ-UD treebank for written Slovenian with new sentences from the ssj500k and ELEXIS-WSD corpora, and created a new hidden UD treebank based on the SentiCoref cor-pus to be used on the SloBENCH evaluation platform. In addition, the SUK and Janes-tag reference training corpora, originally annotated using the language-specific JOS annotation scheme, have been semi-automatically converted to UD part-of-speech categories and morphological features. The new version of the reference SSJ-UD treebank with more than 5,000 new sentences and double the original number of tokens was used to train a new dependency parsing model in the CLASSLA-Stanza annotation tool. This paper gives an in-depth evaluation of its performance with respect to the overall parsing per-formance, the relation-specific parsing performance and the most common types of errors produced.

Ključne besede:linguistic annotation, dependency grammar, treebanks, dependency parsing, natural language processing, computational linguistics, natural language processing (computer science)

Projekti

Financer:Drugi - Drug financer ali več financerjev
Program financ.:Ministrstvo za kulturo Republike Slovenije
Številka projekta:-
Naslov:Razvoj slovenščine v digitalnem okolju
Akronim:RSDO

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:P6-0411
Naslov:Jezikovni viri in tehnologije za slovenski jezik

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Zbirka

To gradivo je del naslednjih zbirk del:
  1. Slovenščina 2.0

Nazaj