<?xml version="1.0"?>
<metadata xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xmlns:dc="http://purl.org/dc/elements/1.1/"><dc:title>Progresivno spodbujevalno učenje za celotelesno humanoidno manipulacijo</dc:title><dc:creator>Kastrevc,	Klemen Jakob	(Avtor)
	</dc:creator><dc:creator>Podobnik,	Janez	(Mentor)
	</dc:creator><dc:creator>Ude,	Aleš	(Komentor)
	</dc:creator><dc:subject>spodbujevalno učenje</dc:subject><dc:subject>humanoidna robotika</dc:subject><dc:subject>progresivno učenje</dc:subject><dc:subject>PPO</dc:subject><dc:subject>manipulacija</dc:subject><dc:subject>IsaacLab</dc:subject><dc:subject>Talos</dc:subject><dc:description>Humanoidni roboti so zasnovani za delo v okoljih, prilagojenih ljudem, zato je manipulacija z usklajenim gibanjem celotnega telesa, hkratno upravljanje rok in nog za doseganje, prijemanje in manipulacijo predmetov, ena izmed ključnih nalog sodobne robotike. Učenje takšnih nalog z metodami spodbujevalnega učenja je zahtevno zaradi kompleksnosti visokodimenzionalnega prostora akcij in kompleksnih nagrad, še posebej kadar so vse nagrade vključene hkrati, saj agent namesto postopnega osvajanja posameznih veščin sklepa kompromise med nasprotujočimi si cilji in konvergira k slabemu lokalnemu minimumu.

Glavni cilj tega dela je učenje strategije za stabilno manipulacijo predmeta s humanoidnim robotom, ki temelji na usklajenem gibanju celotnega telesa, pri čemer se mora robot naučiti učinkovitega izvajanja naloge ob hkratnem zagotavljanju stabilnosti in ravnotežja.
Za reševanje tega problema je uporabljen progresivni pristop: naloga
je razdeljena na tri zaporedne faze učenja, pri čemer vsaka faza nadgradi
naučeno vedenje iz prejšnje faze z novimi funkcijami nagrade. Robot Talos je bil
najprej naučen vzdrževati ravnotežje ob zunanjih motnjah, nato segati po
predmetu na mizi in nazadnje predmet stisniti ter dvigniti. Učenje poteka
v simulacijskem okolju IsaacLab z uporabo metode spodbujevalnega učenja, pri čemer je za optimizacijo strategije uporabljen algoritem PPO (Proximal Policy Optimization). 


Rezultati potrjujejo učinkovitost progresivnega pristopa, saj je robot uspešno usvojil zaporedne faze učenja, od vzdrževanja ravnotežja do izvajanja manipulacijske naloge. V končni fazi je robot uspešno izvedel prijem in dvig predmeta, pri čemer pristop kaže potencial za učenje kompleksnega vedenja z usklajenim gibanjem celotnega telesa pri humanoidnih robotih.</dc:description><dc:date>2026</dc:date><dc:date>2026-09-04 10:10:01</dc:date><dc:type>Diplomsko delo/naloga</dc:type><dc:identifier>186726</dc:identifier><dc:identifier>VisID: 62923</dc:identifier><dc:identifier>COBISS_ID: 290656003</dc:identifier><dc:language>sl</dc:language></metadata>
