AI 中心的数据黑洞:模型变强,靠的仍是海量数据
样本效率衡量达到胜任所需的数据量。作者认为近年进步主要来自数据分布拓宽和算力投入,而非单位数据的学习效率提升。理解这一点,有助于判断模型能力来自哪里,而不是把一切归于架构神话。
智能有一种定义方式:样本效率。在一个领域里,要达到熟练、胜任,到底需要多少数据。按这个标准衡量,过去几年模型的学习效率可能并没有太大进步,真正被大幅拉宽、做好的,是数据的分布。模型变强,主要路径是加入更多、更好的数据,再砸下算力把数据找出来、吃进去。 变强靠的是数据分布 强化学习是这轮提升的核心。可以把它看成一种合成数据生成:对着验证器,或者用大模型当裁判的评分标准,投入海量算力,先筛选出什么是好的数据,再让模型去预测这些正确的 rollout。这和当年让模型预测互联网文本的
来源:youtube 原始内容