为什么AI模型停止学习,以及如何重新启动
萨顿把苦涩教训压缩为随计算扩展,不要被人类知识带偏。它解释了为什么阿尔法零去掉人类棋谱仍能成功,也解释了大模型的双面性:吞下互联网带来扩展,但互联网有限,世界更大,过度依赖人类存量知识最终会受限。用途是判断技术路线是否被人力瓶颈卡住。
强化学习奠基人里奇·萨顿(Rich Sutton)说,自己并不激进,奇怪的是这个领域。在他看来,学习本来就是持续的,不需要加上“持续”这个定语。我们一直在行动,也一直在学习。2003年,他身患癌症,在所谓人工智能寒冬中去了阿尔伯塔大学。被问到为什么在只剩几个月生命时还坚持研究,他引用一句老话:人做事无非出于习惯或虚荣,而他更多是出于习惯。 他带出的学生包括大卫·席尔瓦(David Silver)等人,与前学生库拉姆·贾韦德(Khurram Javed)共同创办了Oak Lab
来源:youtube 原始内容