Search
Jak se pořád neopakovat. Už jsme našli cestu, ale možná někde vedle existuje i lepší.
Máme neznámý kostičkový svět, neznámé velikosti a struktury. Agent se pohybuje neznámýmí směry, s neznámými parametry. Agent vyzkoušel několik trénovacích epizod, zápis je níže v tabulce. Každý řádek v tabulce je n-tice $(s, a, s', r')$.
Určete:
(Svět jako v “Odhad policy z trénovacích epizod, zadání 1 - základní”)
Máme neznámý kostičkový svět, neznámé velikosti a struktury. Agent se pohybuje neznámýmí směry, s neznámými parametry. Agent vyzkoušel několik trénovacích epizod, zápis je níže v tabulce. Každý řádek v tabulce je n-tice $(s, a, s', r)$.
Dokončete práci na úloze Markovské rozhodovací procesy.
Můžete postupně začít pracovat na úloze Posilované učení.
Reinforecement learning je nyní velmi aktivní oblastí, podporovanou také rychlým pokrokem v oblasti učení hlubokých neuronových sítí. Pár odkazů pro další ínspiraci