2019-09-01から1日間の記事一覧

強化学習 Sutton本5章モンテカルロ法について

Sutton本の第5章の内容のメモです前章で扱ったDPとの関係性価値関数の計算や方策評価,改善といった基本的な考え方は一緒 DPと違って環境の完全な知識(期待報酬, 遷移確率など)は必要とせず、経験のみから価値を推定エピソード的(=終わりがある)タスク限定…