Cursor Composer 2 的炼成:用全球分布式基建跑通大规模强化学习
专用模型的价值在于把有限容量全部用于目标分布,并省掉通用能力的负担。对谈中 Composer 因此能以更小的激活规模服务,成本显著低于通用旗舰模型。应用团队可以先评估自家任务是否足够聚焦,再决定是否值得走专用训练,而不是一开始就追求大而全。
Cursor 为什么要从应用公司变成模型公司,又如何把一次超大规模强化学习跑通,是这次对谈的主线。受访的是 Composer 2 的研究负责人 Federico,以及在 Fireworks 负责支撑这次训练基建的 Dima。对谈没有停留在基准分数,而是把训练拆成数据、算法和系统三部分,解释了专用模型为何更便宜,异步流水线为何必然带来陈旧性,全球分散的推理集群如何同步上 TB 级权重,稀疏 MoE 为何对数值误差格外敏感,以及仿真训练和真实用户训练各自解决什么问题。 把所有权重
来源:youtube 原始内容