Podrobno

Stiskanje velikih jezikovnih modelov
ID Burkeljca, Jure (Avtor), ID Robnik Šikonja, Marko (Mentor) Več o mentorju... Povezava se odpre v novem oknu, ID Vreš, Domen (Komentor)

.pdfPDF - Predstavitvena datoteka, prenos (579,11 KB)
MD5: 26B193F2433C59B92CE156FFCFC1334D

Izvleček
Strukturno obrezovanje velikih jezikovnih modelov (VJM) v kombinaciji z destilacijo znanja in kvantizacijo predstavlja učinkovit pristop za pridobivanje manjših in računsko učinkovitejših velikih jezikovnih modelov. Obrezovanje zmanjša število parametrov oziroma velikost VJM-ja, destilacija znanja omogoča ohranjanje njegove zmogljivosti, kvantizacija pa z uporabo nižje numerične natančnosti dodatno zmanjša porabo pomnilnika in računske zahteve, zlasti med izvajanjem VJM-ja. Preizkusili smo 10 različnih kombinacij obrezovanja v širino in globino ter 2 vrsti kvantizacije, FP8 in NVFP4. Vse različice smo ovrednotili s pomočjo Slovenian LLM Eval, podatke o hitrosti ter učinkovitosti pa smo pridobili s pomočjo knjižnice vLLM. V eksperimentu pokažemo, da je med obravnavanimi pristopi strukturnega obrezovanja v povezavi s kratko destilacijo znanja najučinkovitejše zmanjševanje širine VJM, hkrati pa rezultati potrjujejo visoko učinkovitost kvantizacije v formatu FP8. Na podlagi ugotovitev predlagamo tri pristope za učinkovito stiskanje VJMjev in pripravimo VJM z 8 milijardami parametrov, ki je glede na GaMS3 12B 62,3 % manjši, 84,2 % hitrejši in porabi 53,1 % manj energije, ob 12,8 % nižji kakovosti. Destiliran je bil na približno 2 milijardah žetonov.

Jezik:Slovenski jezik
Ključne besede:veliki jezikovni modeli, stiskanje velikih jezikovnih modelov, strukturno obrezovanje velikih jezikovnih modelov, kvantizacija, destilacija znanja, metoda učitelj-učenec
Vrsta gradiva:Diplomsko delo/naloga
Organizacija:FRI - Fakulteta za računalništvo in informatiko
Leto izida:2026
PID:20.500.12556/RUL-187808 Povezava se odpre v novem oknu
Datum objave v RUL:14.09.2026
Število ogledov:11
Število prenosov:3
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Sekundarni jezik

Jezik:Angleški jezik
Naslov:Large Language Model Compression
Izvleček:
Structured pruning of large language models (LLMs) combined with knowledge distillation and quantization represents an effective approach for obtaining smaller and more computationally efficient language models. Pruning reduces the number of parameters and thus the size of the LLM, knowledge distillation helps preserve its performance, while quantization further reduces memory consumption and computational requirements by using lower numerical precision, particularly during LLM inference. We tested ten different combinations of width and depth pruning, as well as two types of quantization, FP8 and NVFP4. We evaluated all variants using Slovenian LLM Eval, while data on speed and efficiency were obtained using the vLLM library. In the experiment, we show that reducing LLM width is the most effective among the evaluated structural compression approaches when combined with short knowledge distillation, while the results also confirm the high efficiency of quantization to the FP8 format. Based on the findings, we propose three efficient LLM compression approaches and develop an 8Bparameter LLM that is 62.3 % smaller, 84.2 % faster, and uses 53.1 % less energy than GaMS3 12B, with a 12.8 % lower quality score after distillation on only 2B tokens.

Ključne besede:large language models, large language model compression, structured pruning, quantization, knowledge distillation, teacher–student method

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Nazaj