Podrobno

Sistolična polja za učinkovito računanje na robnih napravah
ID Grohar, Jurij (Avtor), ID Pilipović, Ratko (Mentor) Več o mentorju... Povezava se odpre v novem oknu

.pdfPDF - Predstavitvena datoteka, prenos (2,73 MB)
MD5: B7BA67FB65F0DC70E11D18C7B473367D

Izvleček
Robne naprave imajo omejene računske vire, zato se za izvajanje nevronskih mrež uporabljajo tudi namenski strojni pospeševalniki na programirljivih vezjih FPGA. V diplomskem delu smo v okolju CFU-Playground razvili namensko procesno enoto za pospeševanje konvolucijskih operacij kvantiziranega modela za razpoznavanje ključnih besed. Enota je povezana s procesorjem RISC-V VexRiscv in vsebuje sistolično polje velikosti 4 × 4. Konvolucijske operacije smo programsko preoblikovali v matrično množenje ter prilagodili pripravo, razporeditev in ponovno uporabo podatkov. Splošna izvedba je šest obravnavanih konvolucijskih operatorjev pohitrila za faktor 16,5, prilagojena izvedba pa za faktor 35,7. Na ravni celotnega profiliranega sklepanja smo dosegli približno 4,8-kratno pohitritev. Napovedi modela so pri obeh izvedbah ostale enake referenčni programski izvedbi.

Jezik:Slovenski jezik
Ključne besede:sistolična polja, robne naprave, konvolucija, FPGA
Vrsta gradiva:Diplomsko delo/naloga
Organizacija:FRI - Fakulteta za računalništvo in informatiko
Leto izida:2026
PID:20.500.12556/RUL-187053 Povezava se odpre v novem oknu
Datum objave v RUL:08.09.2026
Število ogledov:34
Število prenosov:5
Metapodatki:XML DC-XML DC-RDF
:
Kopiraj citat
Objavi na:Bookmark and Share

Sekundarni jezik

Jezik:Angleški jezik
Naslov:Systolic Arrays for Efficient Computing on Edge Devices
Izvleček:
Edge devices have limited computational resources, which makes dedicated hardware accelerators on field-programmable gate arrays (FPGAs) useful for neural network inference. In this thesis, we developed a custom processing unit in the CFU-Playground environment to accelerate convolution operations of a quantized keyword spotting model. The unit is connected to the RISC-V VexRiscv processor and contains a 4 × 4 systolic array. We transformed the convolution operations into matrix multiplication and adapted data preparation, layout, and reuse. The general implementation accelerated the six evaluated convolution operators by a factor of 16.5, while the model-specific implementation achieved a speedup of 35.7. The complete profiled inference was accelerated by approximately 4.8 times. In both implementations, the model outputs remained identical to the reference software implementation.

Ključne besede:systolic arrays, edge devices, convolution, FPGA

Podobna dela

Podobna dela v RUL:
Podobna dela v drugih slovenskih zbirkah:

Nazaj