1. 从棋盘游戏到通用智能:AlphaZero的颠覆性思路
如果你玩过国际象棋或者围棋,肯定知道一个道理:想赢,就得比对手多想几步。人类棋手靠的是经验和直觉,而早期的计算机棋类程序,比如深蓝,走的则是“暴力计算”的路子,把未来所有可能的走法都算一遍,然后选最优的。这个方法在象棋上还行,但到了围棋这种可能性比宇宙原子还多的游戏,就彻底没戏了。
AlphaZero的出现,彻底改变了游戏规则。它不再依赖人类棋谱,也不进行穷举,而是像一个人一样,通过“自我对弈”来学习下棋。它的核心秘诀,就是把两种看似不相关的技术巧妙地“嫁接”在了一起:一边是擅长“深度思考”的蒙特卡洛树搜索,另一边是擅长“直觉判断”的深度强化学习网络。这就像给一个拥有超强计算能力的大脑,又配上了一双能瞬间洞察局势的“火眼金睛”。
我刚开始研究AlphaZero时,也觉得它高深莫测。但后来我发现,拆开来看,它的每个部件其实我们都不陌生。MCTS就像是一个经验丰富的棋手在脑子里反复推演各种变化;而那个深度神经网络,则像是棋手多年训练形成的、对棋盘局势的“第一感觉”。AlphaZero的厉害之处,就在于它让“推演”和“直觉”形成了一个完美的闭环:直觉指导推演的方向,推演的结果又反过来训练和修正直觉。这个闭环通过“自我对弈”不断运转,棋力就像滚雪球一样越滚越强。
所以,这篇文章我想带你彻底搞懂AlphaZero。我们不谈空泛的理论,就从一个最简单的棋盘(比如五子棋)开始,一步步拆解MCTS是怎么搜索的,ResNet网络又是怎么工作的,它们俩到底是如何“打配合”的。我会用很多类比和实际的代码片段,让你能亲手“感受”这个算法的脉搏。你会发现,理解AlphaZero,不仅是理解一个强大的棋类AI,更是理解一种通向通用人工智能的可能路径。
2. 核心引擎:蒙特卡洛树搜索如何“思考”
2.1 MCTS的四步舞:选择、扩展、评估与回溯
你可以把MCTS想象成一个在巨大迷宫里寻宝的聪明探险家。迷宫每一个岔路口就是一个棋盘状态。他不可能走遍所有路,所以他的策略是:花更多时间探索那些看起来更有希望的路。
这个过程被精确地分解为四个步骤,我习惯叫它“四步舞”:
- 选择:从根节点(当前棋局)开始,一路向下选择子节点,直到选到一个“叶子节点”(即还有未探索动作的节点)。选择不是瞎选,它用一个叫PUCT的公式来打分。这个公式平衡了“利用”和“探索”:如果某条路历史胜率高(利用),或者这条路走得少(探索),分数都会更高。这就避免了死磕一条路,也防止错过潜在的好路。
- 扩展:当走到一个叶子节点时,如果游戏没结束,就从当前状态选择一个尚未探索的合法动作,创建一个新的子节点。这个新节点就是这次模拟的起点。
- 评估:这是AlphaZero和早期版本的关键区别。在AlphaGo中,这一步会用快速走子策略“滚”到终局分出胜负。但在AlphaZero里,不再进行随机模拟!而是直接调用我们强大的神经网络。将新节点的棋盘状态输入网络,网络会输出两个值:一个价值v(当前玩家从这个局面获胜的预估概率,范围-1到1),和一个策略概率p(每个可能动作的优先概率)。这个v就作为新节点的初始价值评估。这一步相当于让“直觉”快速给这个新局面打了个分。
- 回溯:拿到评估价值v后,沿着刚刚选择下来的路径反向回溯,更新路径上所有节点的访问次数和总价值。注意一个精妙的设计:因为棋局是双方轮流,所以在回溯时,价值需要带上对手的视角。通常的做法是,在每一层回溯时,对价值取反(
value = -value)。这样,每个节点存储的价值,始终代表当前要走棋的玩家的胜率估计。
这四步构成一次模拟。在AlphaZero实际决策时,这个“四步舞”会反复跳几百次(比如800次)。最终,根节点下各个动作的访问次数,就代表了经过“深思熟虑”后,算法认为的最佳动作概率分布。走棋时,就按这个分布采样或选择访问次数最多的动作。
2.2 可视化理解:一棵不断生长的决策树
光说可能有点抽象,我们来看一个简化例子。假设一个迷你棋盘,只有三个可能动作A、B、C。
- 初始:根节点,访问次数N=0。
- 第一次模拟:
- 选择:由于所有子节点都未访问,PUCT公式中探索项极大,随机(或按网络策略先验)选到动作A。
- 扩展:创建节点A。
- 评估:网络输入A的局面,输出价值v=0.7(局面大好)。
- 回溯:更新节点A(N=1, W=0.7),更新根节点(N=1, W=0.7)。注意,这里根节点的价值是站在对手角度看的,所以可能记录为-0.7,取决于具体实现。
- 第二次模拟:
- 选择:从根节点出发。计算A的PUCT:利用项约为0.7,探索项因为根节点N=1而仍然较大。B和C的探索项更大。假设这次探索项主导,选择了B。
- 扩展:创建节点B。
- 评估:网络输出v=-0.3(局面不利)。


430

被折叠的 条评论
为什么被折叠?



