Vaš brskalnik ne omogoča JavaScript!
JavaScript je nujen za pravilno delovanje teh spletnih strani. Omogočite JavaScript ali pa uporabite sodobnejši brskalnik.
Repozitorij Univerze v Ljubljani
Nacionalni portal odprte znanosti
Odprta znanost
DiKUL
slv
|
eng
Iskanje
Napredno
Novo v RUL
Kaj je RUL
V številkah
Pomoč
Prijava
Podrobno
Assessing reliability of BERT-based models on question answering tasks
ID
Yadav, Pooja
(
Avtor
),
ID
Harjule, Priyanka
(
Avtor
),
ID
Agarwal, Basant
(
Avtor
),
ID
Robnik Šikonja, Marko
(
Avtor
)
PDF - Predstavitvena datoteka,
prenos
(3,84 MB)
MD5: 9CAEE05F93DFB84F202CAB2319D9A59C
URL - Izvorni URL, za dostop obiščite
https://www.tandfonline.com/doi/full/10.1080/0952813X.2026.2716084
Galerija slik
Izvleček
Reliability estimation of large language models is in many cases as crucial as their accuracy, as reliable models are more trustworthy, robust, and suitable for practical applications. Recent advancements in natural language processing (NLP), particularly those based on transformer architectures, have significantly accelerated progress across various NLP tasks. This study focuses on the reliability of transformer-based question answering (QA) models, specifically BERT models and its variants (RoBERTa, ALBERT, DistilBERT). These encoder-only pretrained transformers have demonstrated remarkable accuracy in QA tasks that can be treated as classification tasks. However, their reliability remains underexplored. This study evaluates the reliability of four BERT-based models by assessing response stability under two conditions: (1) internal model variations induced via Monte Carlo Dropout (MCD) and (2) input perturbations through paraphrasing. Using the SQuAD and QuAC datasets, we investigate how dropout rates affect prediction consistency and whether lexical changes impact answer stability. Our findings reveal that RoBERTa maintains higher reliability, whereas AlBERT and DistilBERT exhibit significant inconsistencies. Statistical analyses confirm that enabling MCD during prediction does not disrupt inference dynamics, validating its effectiveness as a reliability metric. These findings underscore the importance of evaluating both accuracy and stability in QA models to ensure stability in real-world applications.
Jezik:
Angleški jezik
Ključne besede:
natural language processing
,
large language models
,
reliability estimation
,
BERT models
,
question answering
Vrsta gradiva:
Članek v reviji
Tipologija:
1.01 - Izvirni znanstveni članek
Organizacija:
FRI - Fakulteta za računalništvo in informatiko
Status publikacije:
Objavljeno
Različica publikacije:
Objavljena publikacija
Leto izida:
2026
Št. strani:
21 str.
Številčenje:
Vol. , no.
PID:
20.500.12556/RUL-186056
UDK:
004.85:004.912:81'322
ISSN pri članku:
0952-813X
DOI:
10.1080/0952813X.2026.2716084
COBISS.SI-ID:
288277507
Datum objave v RUL:
26.08.2026
Število ogledov:
106
Število prenosov:
39
Metapodatki:
Citiraj gradivo
Navadno besedilo
BibTeX
EndNote XML
EndNote/Refer
RIS
ABNT
ACM Ref
AMA
APA
Chicago 17th Author-Date
Harvard
IEEE
ISO 690
MLA
Vancouver
:
Kopiraj citat
Objavi na:
Gradivo je del revije
Naslov:
Journal of experimental & theoretical artificial intelligence
Skrajšan naslov:
J. exp. theor. artif. intell.
Založnik:
Taylor & Francis
ISSN:
0952-813X
COBISS.SI-ID:
15368197
Licence
Licenca:
CC BY 4.0, Creative Commons Priznanje avtorstva 4.0 Mednarodna
Povezava:
http://creativecommons.org/licenses/by/4.0/deed.sl
Opis:
To je standardna licenca Creative Commons, ki daje uporabnikom največ možnosti za nadaljnjo uporabo dela, pri čemer morajo navesti avtorja.
Sekundarni jezik
Jezik:
Slovenski jezik
Ključne besede:
obdelava naravnega jezika
,
veliki jezikovni modeli
,
ocenjevanje zanesljivosti
,
modeli BERT
,
odgovarjanje na vprašanja
Projekti
Financer:
ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:
GC-0002-2024
Naslov:
Veliki jezikovni modeli za digitalno humanistiko
Financer:
ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:
P6-0411-2019
Naslov:
Jezikovni viri in tehnologije za slovenski jezik
Financer:
EC - European Commission
Številka projekta:
101186647
Naslov:
Centre of Excellence in Artificial Intelligence for Digital Humanities
Akronim:
AI4DH
Podobna dela
Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:
Nazaj