Doktorska disertacija naslavlja vrzel v razvoju sodobnih jezikovnih tehnologij za slovenščino, ki kot jezik z manj viri zaostaja za prevladujočimi jeziki, zlasti na področjih generiranja besedil in zahtevnejšega semantičnega sklepanja. Delo združuje izgradnjo nujno potrebnih podatkovnih virov, razvoj novih metodologij za povzemanje in poenostavljanje besedil ter poglobljeno analizo zmožnosti zdravorazumskega sklepanja velikih jezikovnih modelov.
V prvem delu predstavimo infrastrukturne izboljšave, ki predstavljajo temelj za učenje in vrednotenje nevronskih modelov. Razvili smo prenovljeno različico Korpusa akademske slovenščine (KAS 2.0), ki s čistejšo ekstrakcijo in strukturno segmentacijo omogoča pripravo namenskih množic za povzemanje daljših dokumentov in strojno prevajanje. Za standardizirano evalvacijo razumevanja jezika smo vzpostavili slovenski nabor nalog SuperGLUE, ki omogoča neposredno primerjavo zmogljivosti enojezičnih in večjezičnih modelov.
Na področju generiranja besedil uvajamo inovativne pristope za reševanje problema pomanjkanja učnih podatkov. Predstavimo metodo medjezikovnega prenosa za povzemanje, ki s prenosom znanja iz angleških modelov omogoča učinkovito povzemanje slovenskih novic. Nadgradnjo predstavlja razvoj meta-povzemalnika SloMetaSum, ki namesto iskanja univerzalnega modela uporablja nevronsko mrežo za dinamično izbiro najprimernejšega povzemalnika glede na vsebino in strukturo vhodnega dokumenta. Za povečanje dostopnosti informacij smo zasnovali sistem SENTA, prvo celovito rešitev za poenostavljanje slovenskih stavkov, ki združuje klasifikacijo kompleksnosti in generativno preoblikovanje s prilagojenim modelom T5.
Zadnji del naloge se posveča zdravorazumskemu sklepanju. Z izgradnjo razširjene množice KE-WSC, obogatene s strukturiranimi ontološkimi oznakami in človeškimi razlagami, analiziramo vpliv eksplicitnega znanja na uspešnost modelov. Rezultati kažejo, da vključitev razlag izboljša natančnost predvsem pri modelih, specializiranih za logično sklepanje, hkrati pa razkrivajo pomemben razkorak med sposobnostjo modela, da nalogo reši, in njegovo zmožnostjo tvorjenja kakovostne utemeljitve.
Disertacija s prosto dostopnimi podatkovnimi zbirkami, modeli in evalvacijskimi študijami pomembno prispeva k razvoju semantično globokih in uporabniku prilagojenih jezikovnih tehnologij s poudarkom na slovenščini.
|