<?xml version="1.0"?>
<rdf:RDF xmlns:rdf="http://www.w3.org/1999/02/22-rdf-syntax-ns#" xmlns:dc="http://purl.org/dc/elements/1.1/"><rdf:Description rdf:about="https://repozitorij.uni-lj.si/IzpisGradiva.php?id=139799"><dc:title>Izgradnja podpore slovenščini v knjižnici Spacy</dc:title><dc:creator>Dragar,	Luka	(Avtor)
	</dc:creator><dc:creator>Robnik Šikonja,	Marko	(Mentor)
	</dc:creator><dc:subject>obdelava naravnega jezika</dc:subject><dc:subject>označevanje besedil</dc:subject><dc:subject>spacy</dc:subject><dc:subject>korpus</dc:subject><dc:subject>besedni vektorji</dc:subject><dc:description>Predstavljen je postopek izgradnje podpore za slovenščino v okolju Spacy,
ki je ena najpopularnejših knjižnic za obdelavo naravnega jezika. Opisane
so osnovne funkcionalnosti orodij za obdelavo naravnega jezika in predsta-
vljene nekatere obstoječe knjižnice, modeli ter korpusi s tega področja. Po-
drobneje je predstavljeno okolje Spacy in njegova implementacija cevovoda
za označevanje besedil. Praktični del obsega izdelavo novih modelov za le-
matizacijo, oblikoskladenjsko označevanje, skladenjsko razčlenjevanje in pre-
poznavanje imenskih entitet v standardnem in nestandardnem slovenskem
jeziku. Ena od komponent izdelave so besedni vektorji, ki jih generiramo iz
obstoječih prosto dostopnih korpusov. Modeli strojnega učenja so ustvarjeni
s pomočjo odprtokodne knjižnice Thincc. Opisan je postopek konfiguracije
in treniranja modelov na ročno označenih učnih množicah ssj500k (za stan-
dardno slovenščino) in Janes-Tag (za nestandardno slovenščino). Zgrajene
komponente ovrednotimo s primerjavo hitrosti ter natančnosti že obstoječih
modelov.</dc:description><dc:date>2022</dc:date><dc:date>2022-09-07 11:25:12</dc:date><dc:type>Diplomsko delo/naloga</dc:type><dc:identifier>139799</dc:identifier><dc:language>sl</dc:language></rdf:Description></rdf:RDF>
