Vaš brskalnik ne omogoča JavaScript!
JavaScript je nujen za pravilno delovanje teh spletnih strani. Omogočite JavaScript ali pa uporabite sodobnejši brskalnik.
Repozitorij Univerze v Ljubljani
Nacionalni portal odprte znanosti
Odprta znanost
DiKUL
slv
|
eng
Iskanje
Napredno
Novo v RUL
Kaj je RUL
V številkah
Pomoč
Prijava
Podrobno
Up to no good : exploiting word embeddings for an automatic extraction of candidates for a lexicon of Slovene taboo language
ID
Čibej, Jaka
(
Avtor
)
PDF - Predstavitvena datoteka,
prenos
(413,20 KB)
MD5: 6773230F4764F129D0CAA201F4F3F83D
Galerija slik
Izvleček
We present an approach to extracting candidates to be included in an open-access lexicon of Slovene taboo language by using word embeddings compiled from different Slovene corpora and a set of offensive and pejorative seed lexemes from the Thesaurus of Modern Slovene 2.0. While many studies on taboo language rely on surveys to collect data on taboo language and its use, our evaluation shows that the method with embeddings provides a good starting point for the compilation of a more comprehensive and empirically grounded taboo language lexicon. We describe the datasets used in the experiment, the process of extraction and its results, as well as the advantages and disadvantages of this method. From a set of approximately 120 Slovene seed lexemes, the initial analysis of extracted candidates resulted in 1,260 relevant lexemes. We briefly discuss potential future steps in the development of the lexicon in the context of other machine-readable Slovene language resources, such as the Digital Dictionary Database of Slovene. The extraction method is language-independent and can be directly applied to other languages.
Jezik:
Angleški jezik
Ključne besede:
taboo language
,
automatic extraction
,
embeddings
,
Slovene
Vrsta gradiva:
Drugo
Tipologija:
1.08 - Objavljeni znanstveni prispevek na konferenci
Organizacija:
FRI - Fakulteta za računalništvo in informatiko
FF - Filozofska fakulteta
Različica publikacije:
Objavljena publikacija
Leto izida:
2025
Št. strani:
Str. 203-222
PID:
20.500.12556/RUL-176621
UDK:
81'322
ISSN pri članku:
2533-5626
COBISS.SI-ID:
258417411
Datum objave v RUL:
05.12.2025
Število ogledov:
481
Število prenosov:
122
Metapodatki:
Citiraj gradivo
Navadno besedilo
BibTeX
EndNote XML
EndNote/Refer
RIS
ABNT
ACM Ref
AMA
APA
Chicago 17th Author-Date
Harvard
IEEE
ISO 690
MLA
Vancouver
:
Kopiraj citat
Objavi na:
Gradivo je del zbornika
Naslov:
eLex 2025
COBISS.SI-ID:
258410499
Gradivo je del revije
Naslov:
Electronic lexicography in the 21st century. Proceedings of eLex ... conference
Skrajšan naslov:
Electron. lexicogr. 21st cent., Proc. eLex ... conf.
Založnik:
Lexical Computing
ISSN:
2533-5626
COBISS.SI-ID:
1537552579
Licence
Licenca:
CC BY-SA 4.0, Creative Commons Priznanje avtorstva-Deljenje pod enakimi pogoji 4.0 Mednarodna
Povezava:
http://creativecommons.org/licenses/by-sa/4.0/deed.sl
Opis:
Ta licenca Creative Commons je zelo podobna običajni licenci Priznanje avtorstva, vendar zahteva, da so materialne avtorske pravice na izpeljanih delih upravljane z enako licenco.
Sekundarni jezik
Jezik:
Slovenski jezik
Ključne besede:
tabujevsko besedišče
,
strojno luščenje
,
vložitve
,
korpusi
,
slovenščina
Projekti
Financer:
ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:
GC-0002
Naslov:
Veliki jezikovni modeli za digitalno humanistiko
Financer:
EC - European Commission
Številka projekta:
C3.K8.IB
Naslov:
Adaptive Natural Language Processing with Large Language Models
Akronim:
PoVeJMo
Financer:
ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:
P6-0411-2019
Naslov:
Jezikovni viri in tehnologije za slovenski jezik
Financer:
ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:
I0-E004
Naslov:
CLARIN
Podobna dela
Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:
Nazaj