Podrobno

Sistem za zajem, obdelavo in analizo novic slovenskih spletnih medijev : magistrsko delo
ID Brglez, Ema (Avtor), ID Kronegger, Luka (Mentor) Več o mentorju... Povezava se odpre v novem oknu

.pdfPDF - Predstavitvena datoteka, prenos (2,84 MB)
MD5: 70285B62BF9F36C27B26AAD2A9F6FA7D

Izvleček
Spletni mediji so postali osrednji vir informacij, obseg njihovih vsebin pa presega možnosti ročne analize in zahteva sistematične računalniške pristope. Dosedanje raziskave slovenskega medijskega prostora so se osredotočale predvsem na analizo tematik in sentimenta, manj pa na strukturo povezav med akterji v medijskih vsebinah. Magistrsko delo obravnava vprašanje, kako zasnovati sistem za zbiranje, čiščenje in analizo spletnih novic, ki omogoča raziskovanje teh povezav. V ta namen je bil razvit celovit podatkovni cevovod, ki združuje avtomatizirano zbiranje novic prek virov RSS, prepoznavanje imenskih entitet z orodjem CLASSLA, normalizacijo akterjev ter analizo omrežij sopojavljanja, rezultate pa povezuje z interaktivnim spletnim vmesnikom. S sistemom je bil zgrajen korpus 162.810 člankov iz 175 registriranih slovenskih spletnih virov v obdobju štirih mesecev, enota analize pa so povzetki iz virov RSS. Kakovost samodejnega prepoznavanja entitet je bila ovrednotena z ročno validacijo. Rezultati nakazujejo izrazito neenakomerno porazdelitev medijske pozornosti med akterji ter omrežje sopojavljanja z izrazito skupnostno strukturo in značilnostmi omrežij majhnega sveta, v katerem omejeno število akterjev opravlja povezovalno vlogo med domačim in mednarodnim političnim diskurzom. Osrednji prispevek naloge je razvit sistem oziroma dokaz, da je tovrsten cevovod mogoče zasnovati in uporabiti za slovenski jezik, predstavljene ugotovitve pa prikazujejo njegovo uporabnost.

Jezik:Slovenski jezik
Ključne besede:spletni mediji, avtomatiziran zajem podatkov, prepoznavanje imenskih entitet, analiza omrežij sopojavljanja, medijski prostor
Vrsta gradiva:Magistrsko delo/naloga
Tipologija:2.09 - Magistrsko delo
Organizacija:FDV - Fakulteta za družbene vede
Kraj izida:Ljubljana
Založnik:E. Brglez
Leto izida:2026
Št. strani:1 spletni vir (1 datoteka PDF (101 str.))
PID:20.500.12556/RUL-186760 Povezava se odpre v novem oknu
UDK:07:[659.2:004](043.2)
COBISS.SI-ID:290702339 Povezava se odpre v novem oknu
Datum objave v RUL:05.09.2026
Število ogledov:184
Število prenosov:49
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Sekundarni jezik

Jezik:Angleški jezik
Naslov:A system for collecting, processing, and analysing news from Slovenian online media
Izvleček:
Online media have become a central source of information, yet the volume of their content exceeds the limits of manual analysis and calls for systematic computational approaches. Existing research on the Slovenian media landscape has focused mainly on topic and sentiment analysis, while the structure of relations between actors in media content has received less attention. This master's thesis addresses the question of how to design a system for collecting, cleaning, and analysing online news that enables the study of such relations. To this end, a comprehensive data pipeline was developed, integrating automated news collection via RSS feeds, named entity recognition using the CLASSLA tool, actor normalisation, and co-occurrence network analysis, with results linked to an interactive web interface. Using this system, a corpus of 162,810 articles from 175 registered Slovenian online sources was compiled over a four-month period, with RSS summaries serving as the unit of analysis. The quality of automated entity recognition was assessed through manual validation. The results indicate a markedly uneven distribution of media attention across actors, and a co-occurrence network with a pronounced community structure and small-world characteristics, in which a limited number of actors bridge domestic and international political discourse. The central contribution of the thesis is the developed system itself, that is, a demonstration that such a pipeline can be designed and applied to the Slovenian language, while the presented findings illustrate its usefulness.

Ključne besede:online media, automated data collection, named entity recognition, co-occurrence network analysis, media landscape

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Nazaj