Details

Empirična analiza naglašenih enot v slovenščini na podlagi Slovenskega oblikoslovnega leksikona Sloleks
ID Čibej, Jaka (Author)

.pdfPDF - Presentation file, Download (286,47 KB)
MD5: B2A8F4433606C26C0E61738C6A72869D
URLURL - Source URL, Visit https://journals.uni-lj.si/jezikinslovstvo/article/view/21473 This link opens in a new window

Abstract
V prispevku predstavljamo postopek gradnje empirično podprtega izčrpnega seznama naglašenih enot v slovenščini na podlagi Slovenskega oblikoslovnega leksikona Sloleks, in sicer s poudarkom na stalno naglašenih enotah. Obstoječi jezikovni priročniki (npr. Slovenska slovnica, Slovenski pravopis 2001) namreč navajajo le delne podatke brez navedenih pogostosti, strojno berljiv seznam stalno naglašenih enot pa bi zaradi le deloma predvidljivega naglasnega mesta v slovenščini koristil ne le jezikovnim govorcem, temveč tudi strojnim naglaševalnikom. Iz leksikona najprej izvozimo vse naglašene enote in za vsakega od izvoženih naglašenih besednih delov preštejemo, v koliko leksemih se pojavlja, ter izračunamo deleže, v katerih je del naglašen. Na tako pridobljenih podatkih opravimo analizo po besednih vrstah in primerjamo razlike med rezultati, pridobljenimi po našem postopku, in obstoječimi jezikovnimi priročniki. Opišemo sestavo tako nastalega seznama, ki je odprto dostopen na repozitoriju CLARIN.SI, in dokumentiramo postopek njegove gradnje. Novo različico seznama je na enak način mogoče ob posodobitvah leksikona izvoziti z upoštevanjem novih podatkov, ki natančneje odsevajo podobo naglaševanja v slovenščini. V zaključku navedemo še nekaj možnosti za izboljšave in potencialne korake za nadaljnje raziskave.

Language:Slovenian
Keywords:stalno naglašene enote, naglaševanje, slovenščina, oblikoslovni leksikon, Sloleks
Work type:Article
Typology:1.01 - Original Scientific Article
Organization:FF - Faculty of Arts
FRI - Faculty of Computer and Information Science
Publication status:Published
Publication version:Version of Record
Publication date:09.09.2025
Year:2025
Number of pages:Str. 109-124
Numbering:Letn. 70, št. 3
PID:20.500.12556/RUL-175479 This link opens in a new window
UDC:81'374:81'322
ISSN on article:0021-6933
DOI:10.4312/jis.70.3.109-124 This link opens in a new window
COBISS.SI-ID:249406979 This link opens in a new window
Publication date in RUL:29.10.2025
Views:660
Downloads:137
Metadata:XML DC-XML DC-RDF
:
Copy citation
Share:Bookmark and Share

Record is a part of a journal

Title:Jezik in slovstvo
Shortened title:Jez. slovst.
Publisher:Slavistično društvo Slovenije, Slavistično društvo Slovenije, Založba Univerze v Ljubljani, Zveza društev Slavistično društvo Slovenije, Založba Univerze v Ljubljani, Zveza slovenskih slavističnih društev
ISSN:0021-6933
COBISS.SI-ID:746756 This link opens in a new window

Licences

License:CC BY-SA 4.0, Creative Commons Attribution-ShareAlike 4.0 International
Link:http://creativecommons.org/licenses/by-sa/4.0/
Description:This Creative Commons license is very similar to the regular Attribution license, but requires the release of all derivative works under this same license.

Secondary language

Language:English
Title:An empirical analysis of accentuated units in Slovene based on the Sloleks Morphological Lexicon of Slovene
Abstract:
In this paper, we present the process of compiling an empirically based comprehensive list of accentuated units in Slovene based on the Sloleks Morphological Lexicon of Slovene, with an emphasis on constantly accentuated units. Existing language manuals (e.g. the Slovene Grammar and the Slovenian Normative Guide 2001) provide only partial data without specified frequencies. A machine-readable list of constantly accentuated units would be useful not only to language speakers, but also for automatic accentuators due to the only partly predictable place of accentuation in Slovene. We first export all accentuated units from the lexicon, then for each of the exported accentuated word parts we count how many lexemes it occurs in. We calculate the proportions in which the relevant word part is accentuated. We analyse the data obtained in this way by word types and compare the differences between our results and existing Slovene language manuals. We describe the structure of the resulting list, which is openly accessible in the CLARIN.SI repository, and document the process of its compilation. Using the same process, a new version of the list can always be exported when the lexicon is updated, taking into account new data in order to accurately reflect accentuation in Slovene. We finish the paper by listing several possibilities for improvement and potential steps for further research.

Keywords:constantly accentuated units, accentuation, Slovene, morphological lexicon, Sloleks

Projects

Funder:ARIS - Slovenian Research and Innovation Agency
Project number:J7-4642
Name:Temeljne raziskave za razvoj govornih virov in tehnologij za slovenščino

Funder:ARIS - Slovenian Research and Innovation Agency
Project number:P6-0411
Name:Jezikovni viri in tehnologije za slovenski jezik

Funder:ARIS - Slovenian Research and Innovation Agency
Project number:I0-E004
Name:CLARIN

Similar documents

Similar works from RUL:
Similar works from other Slovenian collections:

Collection

This document is a part of these collections:
  1. Jezik in slovstvo

Back