Podrobno

Up to no good : exploiting word embeddings for an automatic extraction of candidates for a lexicon of Slovene taboo language
ID Čibej, Jaka (Avtor)

.pdfPDF - Predstavitvena datoteka, prenos (413,20 KB)
MD5: 6773230F4764F129D0CAA201F4F3F83D

Izvleček
We present an approach to extracting candidates to be included in an open-access lexicon of Slovene taboo language by using word embeddings compiled from different Slovene corpora and a set of offensive and pejorative seed lexemes from the Thesaurus of Modern Slovene 2.0. While many studies on taboo language rely on surveys to collect data on taboo language and its use, our evaluation shows that the method with embeddings provides a good starting point for the compilation of a more comprehensive and empirically grounded taboo language lexicon. We describe the datasets used in the experiment, the process of extraction and its results, as well as the advantages and disadvantages of this method. From a set of approximately 120 Slovene seed lexemes, the initial analysis of extracted candidates resulted in 1,260 relevant lexemes. We briefly discuss potential future steps in the development of the lexicon in the context of other machine-readable Slovene language resources, such as the Digital Dictionary Database of Slovene. The extraction method is language-independent and can be directly applied to other languages.

Jezik:Angleški jezik
Ključne besede:taboo language, automatic extraction, embeddings, Slovene
Vrsta gradiva:Drugo
Tipologija:1.08 - Objavljeni znanstveni prispevek na konferenci
Organizacija:FRI - Fakulteta za računalništvo in informatiko
FF - Filozofska fakulteta
Različica publikacije:Objavljena publikacija
Leto izida:2025
Št. strani:Str. 203-222
PID:20.500.12556/RUL-176621 Povezava se odpre v novem oknu
UDK:81'322
ISSN pri članku:2533-5626
COBISS.SI-ID:258417411 Povezava se odpre v novem oknu
Datum objave v RUL:05.12.2025
Število ogledov:476
Število prenosov:122
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Gradivo je del zbornika

Naslov:eLex 2025
COBISS.SI-ID:258410499 Povezava se odpre v novem oknu

Gradivo je del revije

Naslov:Electronic lexicography in the 21st century. Proceedings of eLex ... conference
Skrajšan naslov:Electron. lexicogr. 21st cent., Proc. eLex ... conf.
Založnik:Lexical Computing
ISSN:2533-5626
COBISS.SI-ID:1537552579 Povezava se odpre v novem oknu

Licence

Licenca:CC BY-SA 4.0, Creative Commons Priznanje avtorstva-Deljenje pod enakimi pogoji 4.0 Mednarodna
Povezava:http://creativecommons.org/licenses/by-sa/4.0/deed.sl
Opis:Ta licenca Creative Commons je zelo podobna običajni licenci Priznanje avtorstva, vendar zahteva, da so materialne avtorske pravice na izpeljanih delih upravljane z enako licenco.

Sekundarni jezik

Jezik:Slovenski jezik
Ključne besede:tabujevsko besedišče, strojno luščenje, vložitve, korpusi, slovenščina

Projekti

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:GC-0002
Naslov:Veliki jezikovni modeli za digitalno humanistiko

Financer:EC - European Commission
Številka projekta:C3.K8.IB
Naslov:Adaptive Natural Language Processing with Large Language Models
Akronim:PoVeJMo

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:P6-0411-2019
Naslov:Jezikovni viri in tehnologije za slovenski jezik

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:I0-E004
Naslov:CLARIN

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Nazaj