<?xml version="1.0"?>
<rdf:RDF xmlns:rdf="http://www.w3.org/1999/02/22-rdf-syntax-ns#" xmlns:dc="http://purl.org/dc/elements/1.1/"><rdf:Description rdf:about="https://repozitorij.uni-lj.si/IzpisGradiva.php?id=170526"><dc:title>Analiza in primerjava uspešnosti velikih jezikovnih modelov pri generiranju spletnih aplikacij na podlagi nepopolnih pozivov</dc:title><dc:creator>Slatnar,	Klemen	(Avtor)
	</dc:creator><dc:creator>Smrdel,	Aleš	(Mentor)
	</dc:creator><dc:subject>umetna inteligenca</dc:subject><dc:subject>veliki jezikovni modeli</dc:subject><dc:subject>internet</dc:subject><dc:subject>uporabniški vmesniki</dc:subject><dc:subject>spletne tehnologije</dc:subject><dc:subject>UMUX</dc:subject><dc:description>Področji velikih jezikovnih modelov in razvoja aplikacij se prepletata, saj
razvijalci spletnih aplikacij vse pogosteje uporabljajo velike jezikovne mo-
dele kot programerske partnerje, v namen izboljšanja svoje učinkovitosti in
produktivnosti. Kljub temu ostaja neraziskano, kateri veliki jezikovni mo-
deli resnično zagotavljajo čim večjo produktivnost, vzporedno z zadovoljivo
uporabniško izkušnjo pri razvoju spletnih aplikacij. Način, s katerim smo se
odločili raziskati opisan problem, je z merjenjem interakcij izbranih modelov
pri avtomatskem generiranju kode (aplikacij) za izbrane probleme ter UMUX
vprašalnikom uporabnikom, ki so avtomatsko generirane aplikacije tudi te-
stirali. Uporabljeni modeli v eksperimentu so bili Claude 3.7 Sonnet, Gemini
2.5 Pro Preview in GPT-4o. Vsakemu izmed izbranih velikih jezikovnih mo-
delov smo zadali tri probleme s pomanjkljivimi in dvoumnimi navodili za
generiranje spletnih aplikacij, s katerimi lahko preverimo njihovo sposobnost
generiranja aplikacij na podlagi navodil v obliki pozivov (navodil, ki jih po-
gosto dobijo programerji od svojih strank). Gledali smo, kako uspešni so ti
modeli pri generiranju aplikacij in koliko dodatnih pozivov je bilo potrebnih
za delujočo aplikacijo. Ugotovili smo, da največjo produktivnost razvijalcem
prinaša Claude 3.7 Sonnet, saj je pri implementaciji zahteval najmanj pose-
gov s strani razvijalca in je deloval najbolj samostojno. Generirane aplikacije
smo nato še testirali s testiranjem uporabnikov, ki so nato odgovorili še na
vprašalnik UMUX. Najboljšo povprečno UMUX oceno je imel Gemini 2.5
Pro Preview, vendar potrebuje več iteracij, kot Claude 3.7 Sonnet.</dc:description><dc:date>2025</dc:date><dc:date>2025-07-08 13:10:02</dc:date><dc:type>Diplomsko delo/naloga</dc:type><dc:identifier>170526</dc:identifier><dc:language>sl</dc:language></rdf:Description></rdf:RDF>
