SARASA(λ)算法物理含义解释

废话不多说 先上图: 可以看到与普通sarsa算法主要的不同在于多了一个矩阵 E(s,a),而至于多出来的奇怪的参数在你理解了这个矩阵的做用后就都一切显得合理了。s取遍所有状态,a取遍所有动作,这和Q-table的架构是一样的,不一样的是这个矩阵学名叫做资格迹矩阵,不理解无所谓,因为不影响理解算法的想法。用大白话说就是这个矩阵起到了本次episode(是本次,因为每个大循环E都要归0)中,记录Ag
相关文章
相关标签/搜索