锐知 - 全球认知雷达

Y Combinator ·

递归会是AI的下一条扩展定律吗

Transformer训练时并行处理全部时间步,速度快且避开了长展开的梯度灾难,但解码仍要保留长上下文,没有把历史压缩进可滚动隐状态。理解这一点,就能明白为什么增加参数不等于增加逐步推理深度,递归的价值在于用同一组权重换取计算深度。

递归为什么重新被提起 2025年有两篇论文让递归重新回到视野中心:分层推理模型HRM和微型递归模型TRM。对谈的基本判断是,与其一味把模型做大,不如在推理时让同一个模型反复调用自己,用递归换取推理深度。两篇论文都没有走大规模预训练路线,而是用很小的参数量去解数独、迷宫和ARC类任务,却取得了当时令人意外的成绩。 这条路线并不是凭空出现。对谈回顾了循环神经网络RNN的历史:RNN就是把同一个模型一次又一次作用于自身,隐状态不断滚动更新。在2016年前后,以Alex Graves

来源:youtube 原始内容