<?xml version="1.0"?>
<metadata xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xmlns:dc="http://purl.org/dc/elements/1.1/"><dc:title>Strojna kategorizacija parafraz z velikimi jezikovnimi modeli</dc:title><dc:creator>Žumer,	Alenka	(Avtor)
	</dc:creator><dc:creator>Robnik Šikonja,	Marko	(Mentor)
	</dc:creator><dc:subject>Kognitivna znanost</dc:subject><dc:subject>Parafraza</dc:subject><dc:subject>parafraziranje</dc:subject><dc:subject>obdelava naravnega jezika</dc:subject><dc:subject>veliki jezikovni modeli</dc:subject><dc:subject>ontologije</dc:subject><dc:subject>kategorizacija</dc:subject><dc:description>Kategorizacija parafraz sistematično razvršča različne tipe jezikovnih transformacij, ki ob spreminjanju površinske oblike ohranjajo pomen besedila. Samodejna kategorizacija parafraz prispeva k boljšemu razumevanju jezikovnih struktur ter izboljšuje interpretabilnost sistemov obdelave naravnega jezika. V tej nalogi smo razvili prvi sistematični pristop k ontološko vodeni kategorizaciji parafraz za slovenščino, ki temelji na velikih jezikovnih modelih. Zaradi specifičnosti slovenščine kot jezika z omejenimi viri smo za kategorizacijo testirali specializirani model GaMS-1B ter večjezični model LLaMA-3.1-8B. Oba temeljita na arhitekturi transformerja, ki trenutno prevladuje na področju obdelave naravnega jezika. Iz štirih angleških korpusov parafraz smo pridobili primere, jih prevedli v slovenščino in tako ustvarili učno množico s 372 označenimi parafraznimi pari. Množica je uporabna za nadaljnje raziskave ter gradnjo modelov kategorizacije slovenskih parafraz. Razvili smo dvonivojsko ontološko shemo s štirimi glavnimi kategorijami in dvanajstimi podkategorijami za kategorizacijo učnih primerov in vodenje prilagoditve modelov. Na tej osnovi smo evalvacijo izvedli kvantitativno z metrikami podobnosti in uspešnosti ter kvalitativno s človeško presojo. Model GaMS je dosegel boljše rezultate pri sintaktičnem in pragmatičnem parafraziranju, LLaMA pa pri leksikalnem in semantičnem. Z analizo rezultatov smo opredelili primerne velikosti učnih množic ter pokazali, da veliki jezikovni modeli za uspešno kategorizacijo potrebujejo na kategorijo le šest do osem primerov.</dc:description><dc:publisher>A. Žumer</dc:publisher><dc:date>2025</dc:date><dc:date>2025-10-11 08:30:21</dc:date><dc:type>Magistrsko delo/naloga</dc:type><dc:identifier>174979</dc:identifier><dc:identifier>UDK: 81'42:004.89(043.2)</dc:identifier><dc:identifier>VisID: 193152</dc:identifier><dc:identifier>COBISS_ID: 253336579</dc:identifier><dc:language>sl</dc:language></metadata>
