Podrobno

Slovene word-sense disambiguation and novelty detection with dictionary examples
ID Škvorc, Tadej (Avtor), ID Robnik Šikonja, Marko (Avtor)

.pdfPDF - Predstavitvena datoteka, prenos (1,28 MB)
MD5: 5368F2D93622A34E6519963EC2B59226
URLURL - Izvorni URL, za dostop obiščite https://www.sciencedirect.com/science/article/pii/S0169023X26000856 Povezava se odpre v novem oknu

Izvleček
Many less-resourced languages struggle with a lack of large, task-specific datasets that are required for solving relevant tasks with modern transformer-based large language models (LLMs). On the other hand, many linguistic resources, such as dictionaries, are rarely used in this context despite their large information contents. We show how LLMs can be used to extend existing language resources in less-resourced languages for two important tasks: word-sense disambiguation (WSD) and threshold-based novelty detection (ND), a task similar to word-sense induction (WSI). We approach the two tasks through the related but much more accessible word-in-context (WiC) task where, given a pair of sentences and a target word, a classification model is tasked with predicting whether the sense of a given word differs between sentences. We demonstrate that a well-trained model for this task can distinguish between different word senses and can be adapted to solve the WSD and ND tasks. The advantage of using the WiC task, instead of directly predicting senses, is that the WiC task does not need pre-constructed sense inventories with a sufficient number of examples for each sense, which are rarely available in less-resourced languages. We show that sentence pairs for the WiC task can be successfully generated from dictionary examples using LLMs. The resulting prediction models outperform existing models on WiC, WSD, and ND tasks. We demonstrate our methodology on the Slovene language, where a monolingual dictionary is available, but word-sense resources are tiny.

Jezik:Angleški jezik
Ključne besede:large language models, word-sense disambiguation, novelty detection, word-in-context, dictionary examples
Vrsta gradiva:Članek v reviji
Tipologija:1.01 - Izvirni znanstveni članek
Organizacija:FRI - Fakulteta za računalništvo in informatiko
Status publikacije:Objavljeno
Različica publikacije:Objavljena publikacija
Leto izida:2026
Št. strani:15 str.
Številčenje:Vol. 166, art. 102638
PID:20.500.12556/RUL-187762 Povezava se odpre v novem oknu
UDK:004.89:81'322
ISSN pri članku:0169-023X
DOI:10.1016/j.datak.2026.102638 Povezava se odpre v novem oknu
COBISS.SI-ID:290903811 Povezava se odpre v novem oknu
Datum objave v RUL:14.09.2026
Število ogledov:10
Število prenosov:2
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Gradivo je del revije

Naslov:Data & knowledge engineering
Skrajšan naslov:Data knowl. eng.
Založnik:Elsevier
ISSN:0169-023X
COBISS.SI-ID:25315584 Povezava se odpre v novem oknu

Licence

Licenca:CC BY 4.0, Creative Commons Priznanje avtorstva 4.0 Mednarodna
Povezava:http://creativecommons.org/licenses/by/4.0/deed.sl
Opis:To je standardna licenca Creative Commons, ki daje uporabnikom največ možnosti za nadaljnjo uporabo dela, pri čemer morajo navesti avtorja.

Sekundarni jezik

Jezik:Slovenski jezik
Ključne besede:veliki jezikovni modeli, razdvoumljanje pomenov besed, detekcija novih pomenov, beseda-v-kontekstu, slovarski primeri

Projekti

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:P6-0411-2019
Naslov:Jezikovni viri in tehnologije za slovenski jezik

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:V5-2297-2022
Naslov:Medijska krajina v Sloveniji med pluralizacijo in homogenizacijo

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:L2-50070-2023
Naslov:Tehnike vektorskih vložitev za medijske aplikacije

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:GC-0002-2024
Naslov:Veliki jezikovni modeli za digitalno humanistiko

Financer:EC - European Commission
Številka projekta:101186647
Naslov:Centre of Excellence in Artificial Intelligence for Digital Humanities
Akronim:AI4DH

Financer:EC - European Commission
Številka projekta:C3.K8.IB
Naslov:Adaptive Natural Language Processing with Large Language Models
Akronim:PoVeJMo

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Nazaj