DRL(八)—— Monte Carlo Tree Search (MCTS)

一个比较有意思的在离散情况下的 planning 方式。 之所以叫做tree search,我觉得就是因为这种方法就是像树杈一样从根部到树叶不断地搜索。就像下图这样: 要注意的是: 每个节点的含义,并不是每个state,而是采取某个特定的action后到达的state,这个state可以是不同的。比如说,从 s 1 s_1 s1​开始,我们如果执行action a 1   =   0 a_1~=~
相关文章
相关标签/搜索