Details

Vizualizacija zgodb z generativnimi modeli
ID Mušič, Nejc (Author), ID Robnik Šikonja, Marko (Mentor) More about this mentor... This link opens in a new window

.pdfPDF - Presentation file, Download (2,95 MB)
MD5: A2134396053F6B66F22D2183C817C059

Abstract
Magistrska naloga obravnava problem vizualizacije zgodb z uporabo generativnih modelov, kjer smo se osredotočili na izboljšanje konsistentnosti likov in kompozicije prizorov. Razvili smo dvofazni sistem. Prva faza transformira besedilo v strukturirane opise prizorov in profile likov. Druga faza pa izvaja vizualizacijo z difuzijskim modelom FLUX.1-dev, podprtim s tehnologijami LoRA za prilagajanje likov, MV-Adapter za generacijo večpoglednih slik, Grounding DINO za detekcijo in SAM za segmentacijo. Sistem smo evalvirali na podatkovni množici PororoSV in zgodbi Pepelka s človeško evalvacijo metrik vizualne kakovosti, konsistentnosti, ustreznosti in ozadja. Rezultati kažejo, da naš pristop presega model Storydall-e na podatkovni množici PororoSV, zlasti v kakovosti in konsistentnosti, vendar je časovno zahteven in omejen pri več kot štirih likih na prizor. Pristop izboljšuje nadzor nad vizualizacijo, vendar zahteva optimizacijo za praktično uporabo ter dodatne raziskave za avtomatizacijo sistema.

Language:Slovenian
Keywords:vizualizacija zgodb, LoRA, FLUX.1-dev, difuzijski modeli, PororoSV, MV-Adapter, SAM, Grounding DINO
Work type:Master's thesis/paper
Typology:2.09 - Master's Thesis
Organization:FRI - Faculty of Computer and Information Science
Year:2025
PID:20.500.12556/RUL-175884 This link opens in a new window
COBISS.SI-ID:258386947 This link opens in a new window
Publication date in RUL:12.11.2025
Views:430
Downloads:150
Metadata:XML DC-XML DC-RDF
:
Copy citation
Share:Bookmark and Share

Secondary language

Language:English
Title:Visualization of Stories with Generative Models
Abstract:
This master’s thesis addresses the challenge of story visualization using generative models, focusing on improving character consistency and scene composition. We developed a two-phase system. The first phase transforms text into structured scene descriptions and character profiles. The second phase performs visualization with the FLUX.1-dev diffusion model, supported by LoRA for character consistency, MV-Adapter for multi-view image generation, Grounding DINO for detection, and SAM for segmentation. The system was evaluated on the PororoSV dataset and the Cinderella story through human evaluation of visual quality, consistency, relevance, and background metrics. Results show that our approach outperforms the Storydall-e model on PororoSV dataset, particularly in quality and consistency, but is computationally intensive and limited for more than four characters per scene. The method enhances control over visualization but requires optimization for practical use and further research to automate the system.

Keywords:story visualization, LoRA, FLUX.1-dev, diffusion models, PororoSV, MV-Adapter, SAM, Grounding DINO

Similar documents

Similar works from RUL:
Similar works from other Slovenian collections:

Back