Details

Prepoznavanje govorjenih ukazov na vgrajenih sistemih
ID Ivanović, Saša (Author), ID Bulić, Patricio (Mentor) More about this mentor... This link opens in a new window

.pdfPDF - Presentation file, Download (1,24 MB)
MD5: 0F05AD012FB934E3D5EDDB554500C4D8

Abstract
Diplomsko delo obravnava prepoznavanje govorjenih ukazov na vgrajenem sistemu s pomočjo strojnega učenja. V okviru dela smo zasnovali in implementirali celoten sistem za prepoznavanje šestih govorjenih ukazov (“left”, “right”, “up”, “down”, “stop”, “go”) na razvojni plošči STM32H750B-DK. Model smo naučili na podatkovni zbirki Google Speech Commands z uporabo konvolucijske nevronske mreže tipa DS-CNN, vhodne značilke pa smo izračunali s postopkom MFCC (Mel-Frequency Cepstral Coefficients). Za zagotovitev primerne velikosti in hitrosti izvajanja na vgrajenem sistemu smo model kvantizirali v format INT8 in ga s pomočjo orodja X-CUBE-AI pretvorili v izvorno kodo C. Na vgrajenem sistemu smo implementirali celoten cevovod obdelave zvočnega signala – od zajema preko avdio vmesnika, filtriranja in prevzorčenja, izračuna MFCC značilk v jeziku C, do zagona modela in prikaza rezultata na zaslonu LCD. Naučeni model je na testni množici dosegel točnost 93,07 %, po kvantizaciji pa 92,90 %, kar potrjuje, da izguba točnosti zaradi kvantizacije ni bistvena. Rezultati kažejo, da je predlagana rešitev primerna za prepoznavanje govorjenih ukazov v realnem času na vgrajenih sistemih z omejenimi računskimi viri.

Language:Slovenian
Keywords:vgrajeni sistemi, prepoznavanje govorjenih ukazov, strojno učenje, MFCC, konvolucijske nevronske mreže, kvantizacija
Work type:Bachelor thesis/paper
Typology:2.11 - Undergraduate Thesis
Organization:FRI - Faculty of Computer and Information Science
Year:2026
PID:20.500.12556/RUL-187038 This link opens in a new window
COBISS.SI-ID:291441411 This link opens in a new window
Publication date in RUL:08.09.2026
Views:122
Downloads:16
Metadata:XML DC-XML DC-RDF
:
Copy citation
Share:Bookmark and Share

Secondary language

Language:English
Title:Keyword Spotting on Embedded Systems
Abstract:
This thesis addresses keyword spotting on an embedded system using machine learning methods. We designed and implemented a complete system for recognizing six spoken commands (“left”, “right”, “up”, “down”, “stop”, “go”) on the STM32H750B-DK development board. The model was trained on the Google Speech Commands dataset using a depthwise separable convolutional neural network (DS-CNN), with input features computed using the MFCC (Mel-Frequency Cepstral Coefficients) method. To achieve a suitable model size and execution speed on the embedded target, the model was quantized to INT8 and converted to C source code using the X-CUBE-AI tool. On the embedded system, we implemented the complete audio processing pipeline – from signal acquisition via the audio interface, filtering and resampling, MFCC feature computation in C, to model inference and result display on the LCD screen. The trained model achieved 93.07 % accuracy on the test set, and 92.90 % after quantization, confirming that the accuracy loss due to quantization is negligible. The results show that the proposed solution is suitable for real-time keyword spotting on embedded systems with limited computational resources.

Keywords:embedded systems, keyword spotting, machine learning, MFCC, convolutional neural networks, quantization

Similar documents

Similar works from RUL:
Similar works from other Slovenian collections:

Back