<?xml version="1.0"?>
<rdf:RDF xmlns:rdf="http://www.w3.org/1999/02/22-rdf-syntax-ns#" xmlns:dc="http://purl.org/dc/elements/1.1/"><rdf:Description rdf:about="https://repozitorij.uni-lj.si/IzpisGradiva.php?id=144592"><dc:title>Primerjava metod za avtomatsko ekstrakcijo podatkov iz spleta</dc:title><dc:creator>MARTIČ,	GAŠPER	(Avtor)
	</dc:creator><dc:creator>Žitnik,	Slavko	(Mentor)
	</dc:creator><dc:subject>ekstrakcija</dc:subject><dc:subject>spletni pajek</dc:subject><dc:subject>ovojnica</dc:subject><dc:subject>novice</dc:subject><dc:description>Namen diplomskega dela je pregledati in ovrednotiti obstoječe metode za avtomatsko ekstrakcijo podatkov s spletnih strani. 
Tovrstne metode preko analize večjega števila podobnih spletnih strani avtomatsko generirajo ovojnico, ki je sposobna s spletne strani izluščiti podatke, tudi če se struktura strani s časom rahlo spremeni.
Rezultati diplomskega dela ponujajo enostaven pregled nad različnimi metodami za pridobivanje podatkov s spletnih strani.
To je lahko koristno za uporabnika, ker iz spletne strani izloči moteče oglase in navigacijske menije, ki odvračajo pozornost od vsebine. 
Kvaliteta posamezne metode se meri v hitrosti in sposobnosti odstranjevanja nerelevantnih podatkov ter ohranjanju tistih, ki so pomembni za dojemanje vsebine.
Izvajanje samih metod je avtomatizirano s pomočjo programa v jeziku Python, ki ga lahko poganjamo iz ukazne vrstice. 
Uporabljani sta obstoječi implementaciji metod RoadRunner in Webstemmer, prikazani pa so rezultati njunega delovanja na petih slovenskih spletnih medijih.
Poleg tega je implementirana tudi polavtomatska metoda pridobivanja podatkov s pomočjo ogrodja Scrapy, da lahko vidimo rezultate in kompleksnost v primerjavi s popolnoma avtomatsko metodo.</dc:description><dc:date>2023</dc:date><dc:date>2023-03-02 15:35:06</dc:date><dc:type>Diplomsko delo/naloga</dc:type><dc:identifier>144592</dc:identifier><dc:language>sl</dc:language></rdf:Description></rdf:RDF>
