锐知 - 全球认知雷达

Dwarkesh Patel ·

批量、显存与机架:大模型推理成本的真实决定因素

延迟下界来自把总参数读一遍,成本下界来自计算。批量小时延迟几乎不变但成本极高,批量增大后权重成本被摊薄,最终由计算决定。慢速模式省不下多少,因为键值缓存和计算无法跨批量摊薄。

这次黑板课从一个定价现象讲起。为什么快速模式贵六倍、快两倍多,能否加钱一直加速,能否反过来做慢速模式,等几分钟换更便宜的价格。结论先放在前面,关键变量是批量大小。分析工具是屋顶线模型,对象是七十二卡的布莱克韦尔机架,看显存带宽和算力两块屋顶,再看模型侧两个时间,处理权重的时间和处理上下文也就是键值缓存的时间。 推理时间由哪两部分决定 估算一次推理要多久,不求精确,只给下界。时间大于等于取数时间与计算时间中更大的那一个。计算时间主要来自有效参数的矩阵乘法,批量大小乘以有效参数量

来源:youtube 原始内容