推理、扩散、世界模型与泛化:YC 论文俱乐部的五篇论文
报告把推理速度从省钱省时间的话题,转为决定智能峰值的因素:只要效果随思考量增加,单位时间能输出的 token 就限制了上限。这意味着做应用和做模型时,推理优化不只是工程,还可能直接改变可用能力。来源中强化学习包在推理外、推理成本超过训练成本的说法,是支持该判断的背景,不是严格证明。
把推理当作能力 YC第一次论文俱乐部从上千报名者中选出百人,涵盖高引用学者与融资数千万美元的创始人,聚在Pioneer重建南湾社区,因为湾区AI人才一半在旧金山,一半在谷歌DeepMind、特斯拉、xAI等所在的南湾。随后斯坦福博士生Tanishk切入主题:推理不应只被看作成本或便利杠杆,而应被看作能力。如果算法性能随思考量增长,那么每秒token速度就决定了能交付的智能上限,他甚至设想未来用两万块B200集中思考一个数学猜想。 他提醒,服务数十亿用户时推理成本已主导训练成本
来源:youtube 原始内容