《强化学习Sutton》读书笔记（三）——动态规划（Dynamic Programming）

时间 2019-12-14

标签强化学习Sutton 读书笔记动态规划 dynamic programming 繁體版

原文原文链接

此为《强化学习》第四章。web 策略评估策略评估 (Policy Evaluation) 首先考虑已知策略 π(a|s) π ( a | s ) ，求解 vπ(s) v π ( s ) 。根据上一节中状态值函数的Bellman等式，有算法 vπ(s)=∑aπ(a|s)∑s′∑rp(s′,r|s,a)[r+γvπ(s′)] v π ( s ) = ∑ a π ( a | s ) ∑ s ′ ∑

>>阅读原文<<

相关文章

相关标签/搜索

DP_动态规划

强化学习笔记

自动化学习笔记

FSFA 读书笔记

MySQL 读书笔记

Thymeleaf 教程

每日一句

每一个你不满意的现在，都有一个你没有努力的曾经。

最新文章

本站公众号

欢迎关注本站公众号,获取更多信息

相关文章

>>更多相关文章<<