Platforma na strani povpraševanja ima za posamezno zahtevo le nekaj deset milisekund za izbiro oglasa, s katerim bo
licitirala, zato izbor poteka v več stopnjah. Posebej pomembna je prva, kjer računsko
nezahteven dvostolpni model oceni veliko število primernih kandidatov, in jih nato približno sto
posreduje zahtevnejšim procesom. Tak model mora zato znati ločiti med dobrimi in slabimi primeri, a ker njegova učna
množica vsebuje le primere preteklih uspešno izbranih oglasov, slabe
primere vzorčimo iz učnega paketa. Vendar pa tako vzorčenje v model vpelje več vrst pristranskosti.
V tem magistrskem delu smo prenovili vzorčenje predizbora v produkcijskem sistemu za
licitiranje v realnem času. Uravnali smo število negativnih primerov v
paketu, pristranskost popravili s sprotnim ocenjevanjem pogostosti
vzorčenja, negativne primere pa razširili z enakomernimi vzorci iz
nabora vseh oglasov. Vzorčenje iz dveh virov zahteva popravek, ki je v
literaturi le nakazan, zato smo ga natančno izpeljali in dokazali njegovo učinkovitost.
Vsako metodo smo preverili v kontroliranem okolju na statičnih podatkih in testirali
v pravem produkcijskem okolju.
Čeprav so naše metode vzorčenja občutno izboljšale razvrščanje kandidatov, se to v finančnih metrikah ni odražalo.
To neskladje pripisujemo prekomerni globini posredovanega
izbora, ki zakrije izboljšano razvrstitev in prepreči, da bi pripomogla k boljšemu poslovnemu izidu.
|