AlphaGo Zero 初探

时间 2021-07-14

原文原文链接

Deepmind 最近发布了 AlphaGo 的最新版本 AlphaGo Zero 的论文，AlphaGo 不再需要学习人类的经验，而是可以自己学习如何下围棋，而且最新的 Zero 可以打败之前的版本。首先，围棋这个游戏是很难用暴力方法来搜索最优路径的，拿只有 9 格的 tic tac toe 游戏来说就有 3^9 ～ 19 000 种可能，每个格子可以是 ❌ ⭕️ 空白三种可能。 AI 如