锐知 - 全球认知雷达

Dwarkesh Patel ·

重做AlphaGo:自对弈、强化学习与大模型未来的启示

围棋的搜索难在广度和深度两个维度:合法点多、终局远。AlphaGo用策略网络剪广度,用价值网络截深度,把不可穷举的树变成可采样的稀疏树。理解任何搜索增强系统时,可先问它分别用什么机制处理广度和深度。

重做AlphaGo的动机很直接。Eric Jang长期做机器人方向的深度网络,他始终困惑:只有十层左右的网络,怎么能把围棋这种需要极深搜索的决策压缩下来。2014到2016年AlphaGo的突破让他入行,而2020年David Wu的开源KataGo已把从零训练出顶尖围棋程序的算力降低约40倍。再加上大模型写代码,当年需要整个团队和数百万美元的事,如今几千美元租算力就可能复现。他想亲手验证,搜索加学习为何成立。 围棋为什么难:规则简单,搜索极大 围棋几分钟能讲清。黑先行,双方

来源:youtube 原始内容