<?xml version="1.0"?>
<rdf:RDF xmlns:rdf="http://www.w3.org/1999/02/22-rdf-syntax-ns#" xmlns:dc="http://purl.org/dc/elements/1.1/"><rdf:Description rdf:about="https://repozitorij.uni-lj.si/IzpisGradiva.php?id=140753"><dc:title>Nenadzorovano učenje za avtomatsko poenostavljanje besedil</dc:title><dc:creator>Gorenc,	Sabina	(Avtor)
	</dc:creator><dc:creator>Robnik Šikonja,	Marko	(Mentor)
	</dc:creator><dc:creator>Stabej,	Marko	(Komentor)
	</dc:creator><dc:subject>obdelava naravnega jezika</dc:subject><dc:description>Za povečanje dostopnosti in raznovrstnosti lahkega branja v slovenščini, ki vsebuje jezikovno prilagojena besedila, smo izdelali prototip sistema, ki avtomatsko poenostavlja
besedila. To je prvi sistem za samodejno pretvarjanje slovenskih povedi in besedil v enostavnejšo obliko. Pripravili smo podatkovno množico za slovenski jezik s poravnanimi enostavnimi in kompleksnimi stavki, ki bo uporabna za nadaljnje raziskave. Uporabili smo model T5 za slovenski jezik, ki je naučen na drugih nalogah s področja naravne obdelave jezika. Model uporablja strojno učenje s prenosom znanja na globokih nevronskih mrežah z arhitekturo kodirnik-dekodirnik. Za iskanje optimalnih vrednosti hiperparametrov in evalvacijo uspešnosti sistema smo uporabili avtomatske mere ROUGE in BERTScore, ki so dokaj visoke in kažejo na uspešnost sistema. Sistem generira enostavčne ali enostavne večstavčne povedi s preprostimi priredji in podredji in ne uporablja trpnika ali
posebnih simbolov. S stališča skladenjske preprostosti je sistem uspešen, bolj podrobno pa smo njegovo uspešnost ocenili še s pomočjo človeške evalvacije z uporabo vprašalnika, ki bi se ga lahko uporabilo za preverjanje razumljivosti in smiselnosti avtomatsko zgeneriranih stavkov tudi v nadaljnjih študijah. Z vprašalnikom smo ugotovili, da model ni preveč uspešen pri tvorjenju smiselnih in razumljivih odstavkov. Večina ocenjevalcev je menila, da so skoraj ali čisto nerazumljivi. Raziskovali smo še kriterije razumljivosti za avtomatsko generirana besedila in ugotovili, da so pomembni kriteriji razumljivosti jedrnatost, jezikovna pravilnost, leksikalna preprostost, skladenjska preprostost, koherenca in povzemalna ustreznost. Določitev kriterijev razumljivosti za avtomatsko generirana besedila je pomemben doprinos k nadaljnjemu razvoju in evalvaciji modelov avtomatskega poenostavljanja besedil, saj omogočajo objektivno oceno razumljivosti takih besedil. Naš
sistem se je najboljše odrezal po kriterijih skladenjske in leksikalne preprostosti, najslabše pa v povzemalni ustreznosti, koherenci in jedrnatosti. Sistem je delno uporaben kot pomoč poenostavljalcem, potencialno pa bi se ga dalo izkoristiti v kombinaciji s povzemanjem za zagotavljanje preprostejšega besedišča in preproste skladenjske strukture.</dc:description><dc:date>2022</dc:date><dc:date>2022-09-18 03:49:31</dc:date><dc:type>Magistrsko delo/naloga</dc:type><dc:identifier>140753</dc:identifier><dc:language>sl</dc:language></rdf:Description></rdf:RDF>
