Podrobno

Grammatical error correction of Slovenian school essays using large language models
ID Klemen, Matej (Avtor), ID Božič, Martin (Avtor), ID Arhar Holdt, Špela (Avtor), ID Robnik Šikonja, Marko (Avtor)

.pdfPDF - Predstavitvena datoteka, prenos (283,61 KB)
MD5: AFB694EBB37BD2A5985C6BF243431B98
URLURL - Izvorni URL, za dostop obiščite https://www.sodobna-pedagogika.net/en/articles/03-2025_grammatical-error-correction-of-slovenian-school-essays-using-large-language-models/ Povezava se odpre v novem oknu
URLURL - Izvorni URL, za dostop obiščite https://www.sodobna-pedagogika.net/clanki/03-2025_popravljanje-slovnicnih-napak-v-slovenskih-esejih-z-velikimi-jezikovnimi-modeli/ Povezava se odpre v novem oknu

Izvleček
Grammatical error correction (GEC) is the task of automatically detecting and correcting grammatical errors in text. Large language models have enabled the development of accurate automated methods for detecting and correcting certain types of errors. In the educational domain, the aim of GEC is to aid teachers in correcting student errors. Excessive paraphrasing is a property of Generative Pre-trained Transformer-based models and is undesirable in the language education context. To avoid this, we develop multiple Slovenian models for correcting errors in spelling, word case (capitalization), word form, and word order. We describe the training data construction, training process, and model evaluation approach using the Šolar-Eval 1.0 corpus of school essays authored by primary and secondary school students. Our quantitative evaluation shows that the developed models have reasonably high accuracy levels, and our qualitative evaluation highlights the strengths and weaknesses of the models and the evaluation process. The analysis reveals multiple challenges and promising future directions for improving both model development and the evaluation process.

Jezik:Angleški jezik
Ključne besede:large language models, grammatical error correction, educational domain, synthetic data construction
Vrsta gradiva:Članek v reviji
Tipologija:1.02 - Pregledni znanstveni članek
Organizacija:FRI - Fakulteta za računalništvo in informatiko
FF - Filozofska fakulteta
Status publikacije:Objavljeno
Različica publikacije:Objavljena publikacija
Leto izida:2025
Št. strani:Str. 162–176
Številčenje:Letn. 76, št. 3
PID:20.500.12556/RUL-182472 Povezava se odpre v novem oknu
UDK:371.68
ISSN pri članku:0038-0474
DOI:10.63384/sptB53z793a Povezava se odpre v novem oknu
COBISS.SI-ID:259208195 Povezava se odpre v novem oknu
Datum objave v RUL:19.05.2026
Število ogledov:253
Število prenosov:202
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Gradivo je del revije

Naslov:Sodobna pedagogika
Skrajšan naslov:Sodob. pedagog.
Založnik:Zveza društev pedagoških delavcev Slovenije
ISSN:0038-0474
COBISS.SI-ID:761348 Povezava se odpre v novem oknu

Licence

Licenca:CC BY-SA 4.0, Creative Commons Priznanje avtorstva-Deljenje pod enakimi pogoji 4.0 Mednarodna
Povezava:http://creativecommons.org/licenses/by-sa/4.0/deed.sl
Opis:Ta licenca Creative Commons je zelo podobna običajni licenci Priznanje avtorstva, vendar zahteva, da so materialne avtorske pravice na izpeljanih delih upravljane z enako licenco.

Sekundarni jezik

Jezik:Slovenski jezik
Izvleček:
Strojno popravljanje slovničnih napak je naloga, ki zajema samodejno zaznavanje in popravljanje slovničnih napak v besedilu. Na področju izobraževanja je cilj metod pomagati učiteljem pri popravljanju napak učencev. Veliki jezikovni modeli omogočajo razvoj natančnih avtomatskih metod za zaznavanje in popravljanje določenih vrst napak. Da bi se izognili pretiranemu parafraziranju, ki je značilno za modele tipa GPT, in je v kontekstu poučevanja jezika nezaželeno, predstavimo več razvitih slovenskih modelov tipa BERT in T5 za popravljanje različnih vrst napak. Te vključujejo črkovalne napake, napake v rabi velikih začetnic, besednih oblik in besednega reda. V članku opišemo postopek ustvarjanja učnih podatkov, postopek učenja ter postopek evalvacije modelov na korpusu Šolar-Eval 1.0, ki vsebuje šolske spise osnovnošolcev in srednješolcev. Avtomatska evalvacija kaže razmeroma visoko natančnost razvitih modelov, medtem ko ročna kvalitativna evalvacija razkrije prednosti in slabosti razvitih modelov ter evalvacijskega postopka. Analiza razkriva številne izzive in obetavne smeri za nadaljnje izboljšave tako pri razvoju modelov kot pri postopku evalvacije.

Ključne besede:veliki jezikovni modeli, popravljanje slovničnih napak, izobraževalna domena, sintetiziranje podatkov

Projekti

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:J7-3159
Naslov:Empirična podlaga za digitalno podprt razvoj pisne jezikovne zmožnosti

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:GC-0002
Naslov:Veliki jezikovni modeli za digitalno humanistiko

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:L2-50070
Naslov:Tehnike vektorskih vložitev za medijske aplikacije

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:P6-0411
Naslov:Jezikovni viri in tehnologije za slovenski jezik

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Program financ.:Young researchers

Financer:EC - European Commission
Program financ.:HE
Številka projekta:101186647
Naslov:Centre of Excellence in Artificial Intelligence for Digital Humanities
Akronim:AI4DH

Financer:EC - European Commission
Številka projekta:C3.K8.IB
Akronim:PoVeJMo

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Nazaj