Podrobno

Orodje za pregled in primerjavo metrik podobnosti besedil
ID Hajdinjak, Tim (Avtor), ID Žitnik, Slavko (Mentor) Več o mentorju... Povezava se odpre v novem oknu

.pdfPDF - Predstavitvena datoteka, prenos (1,18 MB)
MD5: 7ED6419C9C879326C3F1C9898AD566BB

Izvleček
Primerjava podobnosti besedil je pomembna tehnika številnih sodobnih sistemov od spletnih iskalnikov, priporočilnih sistemov do tehnologij RAG, kjer se v fazi pridobivanja (angl. retrieval) prav mera podonosti besedil uporablja za izbiro najustreznejših dokumentov glede na poizvedbo uporabnika. Kljub razširjenosti teh pristopov ni bilo mogoče najti obstoječe rešitve oz. orodja, ki bi uporabniku omogočala na podlagi izbire ene izmed množic vektorskih modelov neposredno primerjavo dveh besedil ali celotnega korpusa besedil, kar je bila motivacija za razvoj rešitve v okviru diplomskega dela. Razvili smo spletno aplikacijo v knjižnici React in ogrodju Flask, ki uporabniku omogoča vnos dveh besedil, izbiro vektorskega modela ter dodatne možnosti preobdelave besedila, kot so občutljivost na velike/male črke, odstranjevanje ločil ter simulacija tipkarskih napak, šuma in premešanih besed. Aplikacija na izbrane metrike izračuna podobnost, poleg tega pa z metodami PCA, t-SNE in UMAP omogoča tudi vizualni prikaz vektorskega prostora besed. V ločenem zavihku je uporabniku predstavljen korpusni način, kjer vnese korpus besedil, izbere vektorski model in poizvedbo, aplikacija pa kot demonstracijo postopka RAG rangira besedila, ki poizvedbi najbolje ustreza.

Jezik:Slovenski jezik
Ključne besede:React, Flask, podobnost besedil, vektorske vložitve
Vrsta gradiva:Diplomsko delo/naloga
Organizacija:FRI - Fakulteta za računalništvo in informatiko
Leto izida:2026
PID:20.500.12556/RUL-187360 Povezava se odpre v novem oknu
Datum objave v RUL:10.09.2026
Število ogledov:39
Število prenosov:9
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Sekundarni jezik

Jezik:Angleški jezik
Naslov:A tool for review and comparison of text similarity metrics
Izvleček:
Text similarity comparison is an important tehnique in many modern systems, from search engines, recommendation systems to RAG technologies, where text similarity is used during the retrieval phase to select the most relevant documents for a user's query. Despite the widespread use of these approaches, no existing solution or tool was found that would allow users to directly compare two texts or an entire corpus of texts based on a selection from a range of vector models. This served as the motivation for developing the solution presented in this thesis. We developed a web application using the React library and Flask framework that allows users to enter two texts, select a vector model and additional text preprocessing options, such as case sensitivity, punctuation removal, and the simulation of typographical errors, noise and shuffled words. The application calculates similarity using selected metrics and additionally provides a visual representation of the vector embedding space using PCA, t-SNA and UMAP methods. In a separate corpus mode view, the user is allowed to enter a text corpus, select a vector model and a query, after which the application ranks the texts according to their relevance to the query, demonstrating the retrival phase of a RAG system.

Ključne besede:React, Flask, text similarity, vector embeddings

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Nazaj