Podrobno

Empirična analiza naglašenih enot v slovenščini na podlagi Slovenskega oblikoslovnega leksikona Sloleks
ID Čibej, Jaka (Avtor)

.pdfPDF - Predstavitvena datoteka, prenos (286,47 KB)
MD5: B2A8F4433606C26C0E61738C6A72869D
URLURL - Izvorni URL, za dostop obiščite https://journals.uni-lj.si/jezikinslovstvo/article/view/21473 Povezava se odpre v novem oknu

Izvleček
V prispevku predstavljamo postopek gradnje empirično podprtega izčrpnega seznama naglašenih enot v slovenščini na podlagi Slovenskega oblikoslovnega leksikona Sloleks, in sicer s poudarkom na stalno naglašenih enotah. Obstoječi jezikovni priročniki (npr. Slovenska slovnica, Slovenski pravopis 2001) namreč navajajo le delne podatke brez navedenih pogostosti, strojno berljiv seznam stalno naglašenih enot pa bi zaradi le deloma predvidljivega naglasnega mesta v slovenščini koristil ne le jezikovnim govorcem, temveč tudi strojnim naglaševalnikom. Iz leksikona najprej izvozimo vse naglašene enote in za vsakega od izvoženih naglašenih besednih delov preštejemo, v koliko leksemih se pojavlja, ter izračunamo deleže, v katerih je del naglašen. Na tako pridobljenih podatkih opravimo analizo po besednih vrstah in primerjamo razlike med rezultati, pridobljenimi po našem postopku, in obstoječimi jezikovnimi priročniki. Opišemo sestavo tako nastalega seznama, ki je odprto dostopen na repozitoriju CLARIN.SI, in dokumentiramo postopek njegove gradnje. Novo različico seznama je na enak način mogoče ob posodobitvah leksikona izvoziti z upoštevanjem novih podatkov, ki natančneje odsevajo podobo naglaševanja v slovenščini. V zaključku navedemo še nekaj možnosti za izboljšave in potencialne korake za nadaljnje raziskave.

Jezik:Slovenski jezik
Ključne besede:stalno naglašene enote, naglaševanje, slovenščina, oblikoslovni leksikon, Sloleks
Vrsta gradiva:Članek v reviji
Tipologija:1.01 - Izvirni znanstveni članek
Organizacija:FF - Filozofska fakulteta
FRI - Fakulteta za računalništvo in informatiko
Status publikacije:Objavljeno
Različica publikacije:Objavljena publikacija
Datum objave:09.09.2025
Leto izida:2025
Št. strani:Str. 109-124
Številčenje:Letn. 70, št. 3
PID:20.500.12556/RUL-175479 Povezava se odpre v novem oknu
UDK:81'374:81'322
ISSN pri članku:0021-6933
DOI:10.4312/jis.70.3.109-124 Povezava se odpre v novem oknu
COBISS.SI-ID:249406979 Povezava se odpre v novem oknu
Datum objave v RUL:29.10.2025
Število ogledov:659
Število prenosov:137
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Gradivo je del revije

Naslov:Jezik in slovstvo
Skrajšan naslov:Jez. slovst.
Založnik:Slavistično društvo Slovenije, Slavistično društvo Slovenije, Založba Univerze v Ljubljani, Zveza društev Slavistično društvo Slovenije, Založba Univerze v Ljubljani, Zveza slovenskih slavističnih društev
ISSN:0021-6933
COBISS.SI-ID:746756 Povezava se odpre v novem oknu

Licence

Licenca:CC BY-SA 4.0, Creative Commons Priznanje avtorstva-Deljenje pod enakimi pogoji 4.0 Mednarodna
Povezava:http://creativecommons.org/licenses/by-sa/4.0/deed.sl
Opis:Ta licenca Creative Commons je zelo podobna običajni licenci Priznanje avtorstva, vendar zahteva, da so materialne avtorske pravice na izpeljanih delih upravljane z enako licenco.

Sekundarni jezik

Jezik:Angleški jezik
Naslov:An empirical analysis of accentuated units in Slovene based on the Sloleks Morphological Lexicon of Slovene
Izvleček:
In this paper, we present the process of compiling an empirically based comprehensive list of accentuated units in Slovene based on the Sloleks Morphological Lexicon of Slovene, with an emphasis on constantly accentuated units. Existing language manuals (e.g. the Slovene Grammar and the Slovenian Normative Guide 2001) provide only partial data without specified frequencies. A machine-readable list of constantly accentuated units would be useful not only to language speakers, but also for automatic accentuators due to the only partly predictable place of accentuation in Slovene. We first export all accentuated units from the lexicon, then for each of the exported accentuated word parts we count how many lexemes it occurs in. We calculate the proportions in which the relevant word part is accentuated. We analyse the data obtained in this way by word types and compare the differences between our results and existing Slovene language manuals. We describe the structure of the resulting list, which is openly accessible in the CLARIN.SI repository, and document the process of its compilation. Using the same process, a new version of the list can always be exported when the lexicon is updated, taking into account new data in order to accurately reflect accentuation in Slovene. We finish the paper by listing several possibilities for improvement and potential steps for further research.

Ključne besede:constantly accentuated units, accentuation, Slovene, morphological lexicon, Sloleks

Projekti

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:J7-4642
Naslov:Temeljne raziskave za razvoj govornih virov in tehnologij za slovenščino

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:P6-0411
Naslov:Jezikovni viri in tehnologije za slovenski jezik

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:I0-E004
Naslov:CLARIN

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Zbirka

To gradivo je del naslednjih zbirk del:
  1. Jezik in slovstvo

Nazaj