【强化学习RL】model-free的prediction和control — MC, TD(λ), SARSA, Q-learning等

时间 2020-12-30

原文原文链接

本系列强化学习内容来源自对David Silver课程的学习课程链接http://www0.cs.ucl.ac.uk/staff/D.Silver/web/Teaching.html 　　在上一文介绍了RL基础概念和MDP后，本文介绍了在model-free情况下（即不知道回报Rs和状态转移矩阵Pss'），如何进行prediction，即预测当前policy的state-value functi