{"id":103693,"date":"2018-10-17T22:30:25","date_gmt":"2018-10-17T19:30:25","guid":{"rendered":"http:\/\/ww-vb.mine.nu\/w108\/actor-critic-algorithms\/"},"modified":"2018-10-17T22:30:25","modified_gmt":"2018-10-17T19:30:25","slug":"actor-critic-algorithms","status":"publish","type":"post","link":"https:\/\/hameed.nwar.uk\/sa\/actor-critic-algorithms\/","title":{"rendered":"Actor Critic Algorithms"},"content":{"rendered":"<p><iframe loading=\"lazy\" width=\"580\" height=\"385\" src=\"https:\/\/www.youtube.com\/embed\/w_3mmm0P0j8\" frameborder=\"0\" allowfullscreen><\/iframe><br \/>\n<br \/>Reinforcement learning is hot right now! Policy gradients and deep q learning can only get us so far, but what if we used two networks to help train and AI &#8230;<br \/>\n<br \/><a href=\"https:\/\/www.youtube.com\/watch?v=w_3mmm0P0j8\">source<\/a><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Reinforcement learning is hot right now! Policy gradients and deep q learning can only get us so far, but what if we used two networks to help train and AI &#8230; source<\/p>\n","protected":false},"author":1,"featured_media":103694,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[21],"tags":[87970,87963,87967,87969,87962,87966,87964,87960,87973,87965,87971,87961,7157,4026,87972,62955,87975,87974,87968,6487,1763,7150,7159,7158,7156,7155,2397,7152,7151,87976],"class_list":["post-103693","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-tie-life-style","tag-a3c-algorithm","tag-a3c-reinforcement-learning","tag-actor-critic","tag-actor-critic-algorithm","tag-actor-critic-algorithms","tag-actor-critic-model","tag-actor-critic-reinforcement-learning","tag-actor-critic-reinforcement-learning-tutorial","tag-actor-critic-algorithms-for-risk-sensitive-mdps","tag-advantage-actor-critic","tag-asynchronous-advantage-actor-critic","tag-incremental-natural-actor-critic-algorithms","tag-movie-2018","tag-movies","tag-natural-actor-critic-algorithms","tag-programming","tag-q-learning","tag-reinforce-algorithm","tag-reinforcement-learning-actor-critic","tag-6487","tag-1763","tag-7150","tag--2017-","tag-7158","tag-7156","tag-7155","tag-2397","tag-7152","tag-7151","tag-87976"],"_links":{"self":[{"href":"https:\/\/hameed.nwar.uk\/sa\/wp-json\/wp\/v2\/posts\/103693","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/hameed.nwar.uk\/sa\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/hameed.nwar.uk\/sa\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/hameed.nwar.uk\/sa\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/hameed.nwar.uk\/sa\/wp-json\/wp\/v2\/comments?post=103693"}],"version-history":[{"count":0,"href":"https:\/\/hameed.nwar.uk\/sa\/wp-json\/wp\/v2\/posts\/103693\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/hameed.nwar.uk\/sa\/wp-json\/wp\/v2\/media\/103694"}],"wp:attachment":[{"href":"https:\/\/hameed.nwar.uk\/sa\/wp-json\/wp\/v2\/media?parent=103693"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/hameed.nwar.uk\/sa\/wp-json\/wp\/v2\/categories?post=103693"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/hameed.nwar.uk\/sa\/wp-json\/wp\/v2\/tags?post=103693"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}