锐知 - 全球认知雷达

Latent Space ·

推理的下一百倍:缓存、推测解码与自我优化

长查询先看缓存,再决定走哪组 GPU。命中缓存可跳过部分预填充,预填充与解码分离后还能各自优化。对读者而言,设计多轮智能体时保留上下文、提高复用,可能是比换模型更直接的降本提速手段。

访谈从一个具体问题开始:如果向推理服务发送 20 万 token 的长查询,背后会发生什么。嘉宾先问的是,这个查询或者其中一部分以前是否来过。因为一旦有重复,就可以用缓存感知路由,把请求送到已有缓存输入的副本上,至少跳过一部分预填充。这对代码、多轮智能体这类常见长输入尤其重要。 如果没有缓存,请求会被送到预填充工作节点。在部分模型上,预填充和解码已经分离。一组 GPU 只处理输入,生成键值缓存并给出首 token,再把状态传给另一组专门做解码的 GPU。解码前面往往还有推测模

来源:youtube 原始内容