<?xml version="1.0"?>
<rdf:RDF xmlns:rdf="http://www.w3.org/1999/02/22-rdf-syntax-ns#" xmlns:dc="http://purl.org/dc/elements/1.1/"><rdf:Description rdf:about="https://repozitorij.uni-lj.si/IzpisGradiva.php?id=162603"><dc:title>Avtomatizirana gradnja učnih korpusov s pomočjo velikih jezikovnih modelov</dc:title><dc:creator>Petkovšek,	Gal	(Avtor)
	</dc:creator><dc:creator>Žitnik,	Slavko	(Mentor)
	</dc:creator><dc:creator>Justin,	Tadej	(Komentor)
	</dc:creator><dc:subject>veliki jezikovni modeli</dc:subject><dc:subject>umetno tvorjeni podatki</dc:subject><dc:subject>obdelava naravnega jezika</dc:subject><dc:subject>uvrščanje besedil</dc:subject><dc:subject>podatkovne množice</dc:subject><dc:description>Zbiranje in označevanje podatkov je drago in zamudno. V tem delu predstavljamo ogrodje, ki izkorišča moč velikih jezikovnih modelov za umetno tvorjenje sintetičnih podatkov. Testirali smo ga na treh nalogah uvrščanja besedil in z njegovo uporabo izboljšali izhodiščen rezultate. Predstavili smo več metod ocenjevanja kvalitete umetnih množic ter predstavili, kako ugotovitve uporabimo za razvoj novih pristopov tvorjenja umetnih primerkov. Razvitih in testiranih je bilo več tehnik umetnega tvorjenja, od katerih izstopa dodajanje pogostih besed v ukazni poziv, kar bistveno izboljša rezultate v primeru, ko imamo na voljo tako majhno množico označenih, kot tudi veliko množico neoznačenih primerkov. Najboljše rezultate smo dosegli z združevanjem umetno tvorjenih podatkov in LLM-označenih primerkov iz velike množice neoznačenih primerkov. Glavni prispevki naloge vključujejo implementacijo ogrodja in razvite strategije tvorjenja, ki smo jih vrednotili z različnimi metrikami na več scenarijih.</dc:description><dc:date>2024</dc:date><dc:date>2024-09-25 15:00:01</dc:date><dc:type>Magistrsko delo/naloga</dc:type><dc:identifier>162603</dc:identifier><dc:language>sl</dc:language></rdf:Description></rdf:RDF>
