latentspacepod
来自 latentspacepod 的公开洞察。
- RAG 之后怎么做检索:混合搜索、Agent 与数据库设计
新工作负载指每家公司都要把大量数据接到 AI,底层变化指 NVMe SSD 加对象存储的老库难以改造的架构。判断方向时可以对照这两条:没有新工作负载,需求撑不起大公司;没有架构代差,很容易被现有系统追上。
- 推理的下一百倍:缓存、推测解码与自我优化
长查询先看缓存,再决定走哪组 GPU。命中缓存可跳过部分预填充,预填充与解码分离后还能各自优化。对读者而言,设计多轮智能体时保留上下文、提高复用,可能是比换模型更直接的降本提速手段。
- 从最强到最省:杰夫·迪恩谈前沿模型、蒸馏与延迟
迪恩认为前沿模型用来发现新能力和暴露短板,轻量模型用来承载低延迟、大规模的日常需求。两者不是二选一,因为蒸馏需要先有强模型,普及需要后有便宜模型。对需要规划模型选型的人,这提示同时跟踪上限突破和单位成本下降。
- Monty:为智能体而写的超快 Python 解释器
简单工具调用安全但表达力弱,完整沙箱强大但重、贵、难自托管。Monty 想做中间层:模型可以直接写代码,又不用拉起外部环境。对选型有用的地方是先看约束,如果必须内网运行或对延迟敏感,再考虑进程内方案。
- Cursor 云端代理:把电脑交给代理,人只负责判断
云端代理的默认要求是改完要测,简单文案可免测,复杂改动要端到端验证。演示中半小时的工作包含起服务和反复试错,交回来的是测过的提交。对读者而言,判断代理是否可用,关键不是看它写得多快,而是看它是否自带可重复的验证过程。
- 把文档变成知识:Neo4j CEO 谈图检索、向量组合与智能体数据底座
图检索的卖点不只是准,还有开发过程更透明:向量分数说不清理由,图把实体和关系写明,可检查可审计。在客服、金融等需要解释依据的场景,可优先评估这种可追溯性,而不只看召回分数。
- GPT-5 如何算出物理新结果:单负振幅从胶子到引力子
o3 替他省下几天计算,GPT-5 在三十分钟内复现黑洞对称性结果,内部模型用十二小时独立证明新公式。理解这条能力曲线,有助于判断何时把繁重推导交给模型,何时留给人工核对。
- 智能体云:Databricks把赌注压在数据与开放接口上
访谈反复强调,模型推理已经够用,缺的是放对位置的数据。传统软件重写的公式是数据就位再加智能体,安全、营销等新产品也是先把客户数据收进来,再让智能体做事。对读者的用途是排优先级:先解决数据可访问和新鲜度,再谈智能体选型。
- Devin的80%时刻:后台智能体如何改写编码
规格足够好时,模型可独立走完改代码到PR,7倍PR和80%自家提交占比是佐证。对团队的用处是:先把需求写清、可测,再谈后台并行;规格不清时仍需人在回路。
- Exo:让支架看见自己的代码和日志,在运行中改写自己
Exo 被定义为完全递归的智能体,能在运行时安全改写自身各方面。理解时可抓住收拢循环四字:把外部观察与优化压进运行系统,让同一系统边做边看边改,而不是内外各管一摊。
- 以光速做推理:英伟达如何像创业公司一样运转
嘉宾把质量、成本、速度看作联合约束:模型选多大、思考多长、重试几次、工作流多复杂,都会同时影响三者。Dynamo 的价值在于提供运行时旋钮,让团队在满足时延 SLA 的前提下找最低成本配置。实践中可先固定 SLA,再小步试验并行度和部署形态,而不是寻找一次性公式。
- 2026年语音智能体:为什么繁琐的级联管线仍是主流
当前主流是语音转文字、大模型、文字转语音三步走,中间还有传输、降噪、轮次判断和流式播放。理解这条链,才能定位问题出在听错、想错还是说错,选型时逐段替换。
- 为什么要造科幻:Cloudflare 谈智能体的执行架构与原创
长运行智能体的关键不在多加功能,而在执行侧能否便宜、隔离、可恢复。理解这一点后,选型时可以先问状态放在哪、失败怎么续跑,再看上层框架。
- OpenAI 的 AI 超级应用设想:把智能体的能力带给做知识工作的人
企业没有统一解法。不同团队嘴上都说要数据和 AI,落到具体场景立刻分散。做法是走到用户原本的工作里,看清他们要解决的用例,再教他们用 AI 获得杠杆,而不是先推一套标准答案。
- 让 DeepSeek V4 超越 Opus 4.7:品味文件与工具调用修复
Taste 不是一次性写下的宏大规范,而是从合并记录的接受、修改和拒绝中提炼的微观偏好,存放在仓库里的文本文件,随评审更新。用法是先用高质量模型沉淀,再让便宜模型沿用,七十多名开发者的观察显示人工纠偏减少,但样本有限,效果需结合自身仓库验证。
- OpenClaw 记不住事?Supermemory 的钩子记忆与混合方案
作者把现代记忆拆成四件事:旧知识失效与叠加、时间推理、遗忘、常驻用户画像。这意味着做记忆不能只存向量,还要设计更新、时间戳、遗忘策略和每次对话都带上的小型侧写,适合用来检查自己的记忆方案缺了哪一块。
- 代码依然重要:把软件工程老方法翻译到 AI 时代
作者反对把 AI 当作不用看代码的编译器。他每次忽略代码都得到混乱的结果,因此主张保留对架构和模块的理解。判断标准很直接:人好改的代码,AI 也好改。这可以用来决定何时先重构、何时再让 AI 大规模改动。
- 逆向追踪 OpenAI 训练数据:海马表情符号暴露的推理痕迹
Maini 的博士主题是把混乱网页数据用得又高效又负责任:效率指只用有用的部分,责任指署名、安全与行为评估。这提示读者在谈数据工作时同时交代性能收益与风险处理,而不是只讲规模。
- 上下文图谱:智能体落地缺的那层机构记忆
作者认为智能体缺的是决策理由,而非单点能力。做企业AI时应优先沉淀例外批准、冲突解决和先例引用,否则模型再强也难以可靠落地。
- Dreamer:给所有人的智能体操作系统
软件替人办事的前提是可信。Dreamer因此把隐私安全放在核心,用类似操作系统的权限设计来约束数据获取和协作,而不是只做零散的生成式小应用。这对使用者意味着:先看权限和调用规则,再看功能是否强大。