Details

Grammatical error correction of Slovenian school essays using large language models
ID Klemen, Matej (Author), ID Božič, Martin (Author), ID Arhar Holdt, Špela (Author), ID Robnik Šikonja, Marko (Author)

.pdfPDF - Presentation file, Download (283,61 KB)
MD5: AFB694EBB37BD2A5985C6BF243431B98
URLURL - Source URL, Visit https://www.sodobna-pedagogika.net/en/articles/03-2025_grammatical-error-correction-of-slovenian-school-essays-using-large-language-models/ This link opens in a new window
URLURL - Source URL, Visit https://www.sodobna-pedagogika.net/clanki/03-2025_popravljanje-slovnicnih-napak-v-slovenskih-esejih-z-velikimi-jezikovnimi-modeli/ This link opens in a new window

Abstract
Grammatical error correction (GEC) is the task of automatically detecting and correcting grammatical errors in text. Large language models have enabled the development of accurate automated methods for detecting and correcting certain types of errors. In the educational domain, the aim of GEC is to aid teachers in correcting student errors. Excessive paraphrasing is a property of Generative Pre-trained Transformer-based models and is undesirable in the language education context. To avoid this, we develop multiple Slovenian models for correcting errors in spelling, word case (capitalization), word form, and word order. We describe the training data construction, training process, and model evaluation approach using the Šolar-Eval 1.0 corpus of school essays authored by primary and secondary school students. Our quantitative evaluation shows that the developed models have reasonably high accuracy levels, and our qualitative evaluation highlights the strengths and weaknesses of the models and the evaluation process. The analysis reveals multiple challenges and promising future directions for improving both model development and the evaluation process.

Language:English
Keywords:large language models, grammatical error correction, educational domain, synthetic data construction
Work type:Article
Typology:1.02 - Review Article
Organization:FRI - Faculty of Computer and Information Science
FF - Faculty of Arts
Publication status:Published
Publication version:Version of Record
Year:2025
Number of pages:Str. 162–176
Numbering:Letn. 76, št. 3
PID:20.500.12556/RUL-182472 This link opens in a new window
UDC:371.68
ISSN on article:0038-0474
DOI:10.63384/sptB53z793a This link opens in a new window
COBISS.SI-ID:259208195 This link opens in a new window
Publication date in RUL:19.05.2026
Views:254
Downloads:202
Metadata:XML DC-XML DC-RDF
:
Copy citation
Share:Bookmark and Share

Record is a part of a journal

Title:Sodobna pedagogika
Shortened title:Sodob. pedagog.
Publisher:Zveza društev pedagoških delavcev Slovenije
ISSN:0038-0474
COBISS.SI-ID:761348 This link opens in a new window

Licences

License:CC BY-SA 4.0, Creative Commons Attribution-ShareAlike 4.0 International
Link:http://creativecommons.org/licenses/by-sa/4.0/
Description:This Creative Commons license is very similar to the regular Attribution license, but requires the release of all derivative works under this same license.

Secondary language

Language:Slovenian
Abstract:
Strojno popravljanje slovničnih napak je naloga, ki zajema samodejno zaznavanje in popravljanje slovničnih napak v besedilu. Na področju izobraževanja je cilj metod pomagati učiteljem pri popravljanju napak učencev. Veliki jezikovni modeli omogočajo razvoj natančnih avtomatskih metod za zaznavanje in popravljanje določenih vrst napak. Da bi se izognili pretiranemu parafraziranju, ki je značilno za modele tipa GPT, in je v kontekstu poučevanja jezika nezaželeno, predstavimo več razvitih slovenskih modelov tipa BERT in T5 za popravljanje različnih vrst napak. Te vključujejo črkovalne napake, napake v rabi velikih začetnic, besednih oblik in besednega reda. V članku opišemo postopek ustvarjanja učnih podatkov, postopek učenja ter postopek evalvacije modelov na korpusu Šolar-Eval 1.0, ki vsebuje šolske spise osnovnošolcev in srednješolcev. Avtomatska evalvacija kaže razmeroma visoko natančnost razvitih modelov, medtem ko ročna kvalitativna evalvacija razkrije prednosti in slabosti razvitih modelov ter evalvacijskega postopka. Analiza razkriva številne izzive in obetavne smeri za nadaljnje izboljšave tako pri razvoju modelov kot pri postopku evalvacije.

Keywords:veliki jezikovni modeli, popravljanje slovničnih napak, izobraževalna domena, sintetiziranje podatkov

Projects

Funder:ARIS - Slovenian Research and Innovation Agency
Project number:J7-3159
Name:Empirična podlaga za digitalno podprt razvoj pisne jezikovne zmožnosti

Funder:ARIS - Slovenian Research and Innovation Agency
Project number:GC-0002
Name:Veliki jezikovni modeli za digitalno humanistiko

Funder:ARIS - Slovenian Research and Innovation Agency
Project number:L2-50070
Name:Tehnike vektorskih vložitev za medijske aplikacije

Funder:ARIS - Slovenian Research and Innovation Agency
Project number:P6-0411
Name:Jezikovni viri in tehnologije za slovenski jezik

Funder:ARIS - Slovenian Research and Innovation Agency
Funding programme:Young researchers

Funder:EC - European Commission
Funding programme:HE
Project number:101186647
Name:Centre of Excellence in Artificial Intelligence for Digital Humanities
Acronym:AI4DH

Funder:EC - European Commission
Project number:C3.K8.IB
Acronym:PoVeJMo

Similar documents

Similar works from RUL:
Similar works from other Slovenian collections:

Back