强化学习系列之五:价值函数近似

时间 2020-12-29

原文原文链接

目前，我们已经介绍了一些强化学习的算法，但是我们无法在实际问题中运用这些算法。为什么呢？因为算法估算价值函数 (v(s)) 或者 (q(s,a))，保存这些价值函数意味着保存所有状态。而实际问题中，状态的数目非常巨大，遍历一遍的事情就别想了。比如，围棋的状态总数是(3^{19})，听说比宇宙的总原子数还多，23333。解决这个问题的方法是抽特征。对于一个状态 s, 我们抽取一些特征

>>阅读原文<<