Details

Veliki jezikovni modeli za računalniško oceno osebnostne organizacije iz kliničnih intervjujev z mladostniki : magistrsko delo
ID Lodrant, Katarina (Author), ID Scharnowski, Frank (Mentor) More about this mentor... This link opens in a new window, ID Steyrl, David (Comentor)

.pdfPDF - Presentation file, Download (7,27 MB)
MD5: 10788571D66367C3E0C286C1AE7F257F

Abstract
Pri polstrukturiranih intervjujih v psihiatriji strokovnjaki odgovore pacientov pretvarjajo v številčne ocene na podlagi vnaprej določenih ocenjevalnih kriterijev. Veliki jezikovni modeli (VJM-ji) bi lahko bili primerni za tovrstne naloge, saj lahko obdelujejo obsežna besedila v naravnem jeziku, sledijo podanim navodilom in ustvarjajo strukturirane izhode. Njihova ustreznost za ocenjevanje duševnega zdravja še ni bila zadostno ovrednotena. V magistrskem delu smo razvili in ovrednotili postopek, ki uporablja VJM za ocenjevanje funkcioniranja identitete, osrednje razsežnosti osebnostne organizacije, iz transkripcij Strukturiranega intervjuja osebnostne organizacije za mladostnike (Structured Interview of Personality Organization—Revised, Adolescent Version; STIPO-R-A). Model GPT-5.1 je prejel odlomke transkripcij in ocenjevalne kriterije instrumenta STIPO-R-A ter bil pozvan, naj generira številčne ocene za 19 postavk domene identiteta. Ujemanje med ocenami VJM-ja in kliničnih strokovnjakov smo preverili na vzorcu 72 nemško govorečih mladostnikov, ki je zajemal celoten spekter patologije, od integrirane do izrazito difuzne identitete. Na podvzorcu 23 primerov smo dodatno preučili ponovljivost ocen modela ter njihovo občutljivost na spremembe predloge poziva in spremembo parametra intenzivnosti sklepanja (ang. reasoning-effort). VJM je udeležence po resnosti difuzije identitete razvrstil podobno kot klinični ocenjevalci. Skupne ocene VJM-ja in kliničnih strokovnjakov so močno korelirale, vendar je VJM ustvaril ožji razpon ocen ter resne primere ocenjeval nižje kot klinični strokovnjaki. Stopnja ujemanja se je močno razlikovala med posameznimi postavkami. Najvišja je bila pri postavkah, ki temeljijo predvsem na eksplicitni vsebini odgovorov, najnižja pa pri štirih postavkah, ki zahtevajo interpretativno presojo kakovosti udeleženčevih opisov sebe in pomembne druge osebe. Večina neujemanj je predstavljala odstopanje za eno stopnjo na ocenjevalni lestvici. Mere ujemanja so bile konsistentne pri ponovljenih ocenjevanjih, ob različicah predloge poziva in ob povečani intenzivnosti sklepanja. Posamezne ocene so se med temi pogoji nekoliko spreminjale, vendar večinoma le za eno stopnjo lestvice. To delo predstavlja eno prvih analiz uporabe VJM za ocenjevanje osebnostne organizacije iz kliničnih intervjujev s pacienti. Analiza vzorcev neujemanja med ocenami VJM-ja in kliničnih strokovnjakov je pokazala na konkretne možne izboljšave ocenjevalnega postopka. Te ugotovitve bi lahko koristile tudi kliničnim strokovnjakom, ki razvijajo in uporabljajo kriterije STIPO. Zaradi občutljivosti obravnavanega področja je treba zagotoviti, da se avtomatizirani postopki za ocenjevanje duševnega zdravja uporabljajo le, kadar so podprti z zadostnimi dokazi o veljavnosti in kadar je njihova uporaba upravičena glede na povezana tveganja.

Language:English
Keywords:veliki jezikovni modeli, VJM_kot_ocenjevalec, osebnostna motnja, osebnostna organizacija, difuzija identitete
Work type:Master's thesis/paper
Typology:2.09 - Master's Thesis
Organization:PEF - Faculty of Education
Place of publishing:Ljubljana
Publisher:K. Lodrant
Year:2026
Number of pages:104 str.
PID:20.500.12556/RUL-189479 This link opens in a new window
UDC:004.89(043.2)
COBISS.SI-ID:294168835 This link opens in a new window
Publication date in RUL:07.10.2026
Views:30
Downloads:6
Metadata:XML DC-XML DC-RDF
:
Copy citation
Share:Bookmark and Share

Secondary language

Language:Slovenian
Title:Large language models for the computational assessment of personality organization in clinical interviews with adolescents
Abstract:
In semi-structured psychiatric interviews, clinicians translate patients' verbal accounts into quantitative ratings by applying explicit rating criteria. Large language models (LLMs) can process extended natural-language input and apply written instructions to generate structured outputs, making them plausible tools for this task. However, their suitability for mental health assessment remains to be established. This thesis develops and evaluates an LLM-based measurement procedure for assessing identity functioning, a central dimension of personality organization, from transcripts of the Structured Interview of Personality Organization—Revised, Adolescent Version (STIPO-R-A). The LLM GPT-5.1 was supplied with transcript excerpts and the verbatim STIPO-R-A rating criteria, and prompted to assign numeric ratings to the 19 items of the Identity domain. Agreement between LLM and clinician ratings was evaluated in a sample of 72 German-speaking adolescents spanning the full spectrum from integrated identity to severe identity diffusion. In a subsample of 23 cases, additional analyses examined the stability of LLM ratings across repeated runs, as well as their sensitivity to changes in the prompt template and in a model parameter controlling reasoning effort. The LLM ranked participants by identity-diffusion severity in close agreement with clinicians. The LLM and clinician Identity Sum scores showed a strong correlation, though the LLM produced a narrower range of ratings and tended to rate severe cases lower than clinicians did. Agreement varied widely across individual items. It was highest for items whose ratings could be derived relatively directly from the content of participants’ responses, and lowest for four items requiring a more interpretive judgment of the quality of their descriptions of themselves and a significant other. Most disagreements fell on adjacent scale points. Aggregate measures of agreement were consistent across repeated runs, prompt-template variants, and increased reasoning effort. Individual ratings varied somewhat across these conditions, though mostly within one scale point. This thesis provides one of the first evaluations of LLM-based assessment of personality organization from real-world clinical interview data. The analysis of patterns of LLM-clinician disagreement pointed to concrete revisions to the rating procedure, and may be useful to clinicians developing and applying the STIPO criteria. Given the sensitivity of the domain, automated rating procedures in mental health assessment should be used only when there is sufficient evidence supporting their validity and when their use is justified in light of the associated risks.

Keywords:large language models, LLM-as-a-judge, personality disorder, personality organization, identity diffusion

Similar documents

Similar works from RUL:
Similar works from other Slovenian collections:

Back