Podrobno

Assessing reliability of BERT-based models on question answering tasks
ID Yadav, Pooja (Avtor), ID Harjule, Priyanka (Avtor), ID Agarwal, Basant (Avtor), ID Robnik Šikonja, Marko (Avtor)

.pdfPDF - Predstavitvena datoteka, prenos (3,84 MB)
MD5: 9CAEE05F93DFB84F202CAB2319D9A59C
URLURL - Izvorni URL, za dostop obiščite https://www.tandfonline.com/doi/full/10.1080/0952813X.2026.2716084 Povezava se odpre v novem oknu

Izvleček
Reliability estimation of large language models is in many cases as crucial as their accuracy, as reliable models are more trustworthy, robust, and suitable for practical applications. Recent advancements in natural language processing (NLP), particularly those based on transformer architectures, have significantly accelerated progress across various NLP tasks. This study focuses on the reliability of transformer-based question answering (QA) models, specifically BERT models and its variants (RoBERTa, ALBERT, DistilBERT). These encoder-only pretrained transformers have demonstrated remarkable accuracy in QA tasks that can be treated as classification tasks. However, their reliability remains underexplored. This study evaluates the reliability of four BERT-based models by assessing response stability under two conditions: (1) internal model variations induced via Monte Carlo Dropout (MCD) and (2) input perturbations through paraphrasing. Using the SQuAD and QuAC datasets, we investigate how dropout rates affect prediction consistency and whether lexical changes impact answer stability. Our findings reveal that RoBERTa maintains higher reliability, whereas AlBERT and DistilBERT exhibit significant inconsistencies. Statistical analyses confirm that enabling MCD during prediction does not disrupt inference dynamics, validating its effectiveness as a reliability metric. These findings underscore the importance of evaluating both accuracy and stability in QA models to ensure stability in real-world applications.

Jezik:Angleški jezik
Ključne besede:natural language processing, large language models, reliability estimation, BERT models, question answering
Vrsta gradiva:Članek v reviji
Tipologija:1.01 - Izvirni znanstveni članek
Organizacija:FRI - Fakulteta za računalništvo in informatiko
Status publikacije:Objavljeno
Različica publikacije:Objavljena publikacija
Leto izida:2026
Št. strani:21 str.
Številčenje:Vol. , no.
PID:20.500.12556/RUL-186056 Povezava se odpre v novem oknu
UDK:004.85:004.912:81'322
ISSN pri članku:0952-813X
DOI:10.1080/0952813X.2026.2716084 Povezava se odpre v novem oknu
COBISS.SI-ID:288277507 Povezava se odpre v novem oknu
Datum objave v RUL:26.08.2026
Število ogledov:106
Število prenosov:39
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Gradivo je del revije

Naslov:Journal of experimental & theoretical artificial intelligence
Skrajšan naslov:J. exp. theor. artif. intell.
Založnik:Taylor & Francis
ISSN:0952-813X
COBISS.SI-ID:15368197 Povezava se odpre v novem oknu

Licence

Licenca:CC BY 4.0, Creative Commons Priznanje avtorstva 4.0 Mednarodna
Povezava:http://creativecommons.org/licenses/by/4.0/deed.sl
Opis:To je standardna licenca Creative Commons, ki daje uporabnikom največ možnosti za nadaljnjo uporabo dela, pri čemer morajo navesti avtorja.

Sekundarni jezik

Jezik:Slovenski jezik
Ključne besede:obdelava naravnega jezika, veliki jezikovni modeli, ocenjevanje zanesljivosti, modeli BERT, odgovarjanje na vprašanja

Projekti

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:GC-0002-2024
Naslov:Veliki jezikovni modeli za digitalno humanistiko

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:P6-0411-2019
Naslov:Jezikovni viri in tehnologije za slovenski jezik

Financer:EC - European Commission
Številka projekta:101186647
Naslov:Centre of Excellence in Artificial Intelligence for Digital Humanities
Akronim:AI4DH

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Nazaj