ai-frontier
关于 ai-frontier 的公开洞察。
- Cursor Composer 2 的炼成:用全球分布式基建跑通大规模强化学习
专用模型的价值在于把有限容量全部用于目标分布,并省掉通用能力的负担。对谈中 Composer 因此能以更小的激活规模服务,成本显著低于通用旗舰模型。应用团队可以先评估自家任务是否足够聚焦,再决定是否值得走专用训练,而不是一开始就追求大而全。
- 杰夫·迪恩:在 AI 时代,用 1% 的思路找大事
一年前说 AI 像初级工程师,现在看基本成立,尤其在长时间智能体编程任务上。超出预期的是复杂任务进步更快,且能力开始溢出到代码之外。用途是校准预期:不要只按单次问答评估模型,要按它能连续工作多久、能拆多复杂的任务来评估。
- Claude Code 创造者自述:为六个月后的模型做产品
作者建议不要只优化今天可用的能力,而去试探模型勉强做不好的边界,为半年后的水平做产品。好处是新模型发布时自然变强,风险是当下可能找不到可用场景,需要接受等待和反复重写。
- RAG 之后怎么做检索:混合搜索、Agent 与数据库设计
新工作负载指每家公司都要把大量数据接到 AI,底层变化指 NVMe SSD 加对象存储的老库难以改造的架构。判断方向时可以对照这两条:没有新工作负载,需求撑不起大公司;没有架构代差,很容易被现有系统追上。
- Simon Willison:让编码智能体真正干活的工程实践
作者把红绿测试驱动开发当作每轮必备开场:先给运行测试的方法,再要求测试先行、最小实现。他认为测试现在成本很低,不写测试就让智能体写代码更容易失控。这个做法适合直接放进自己的智能体工作流,是否提升一次成功率需要按项目验证。
- 终端为何成为 AI 编程的工作台:Warp 创始人谈智能体融合与意图瓶颈
终端以文本输入输出和可记录的时间线组织工作,便于同时调度多个智能体。对习惯在终端里完成构建、部署和运维的读者,这意味着可以把智能体放在主工作流里,而不是只当作编辑器的插件。
- 弗朗索瓦·肖莱:只靠规模化,走不到通用智能
Indium 不做上层代码智能体,而是把参数曲线换成尽可能小的符号模型,并探索符号空间中的搜索方法。模型越简洁,所需数据越少,推理越省,泛化与组合也更好。这可用于理解它与深度学习在基座层面的分歧。
- 为智能体做好准备:Stripe 谈代理经济、欺诈与新的收费方式
互联网不再默认只有人这一种行动者,智能体代操作、软件直接对接软件都在变多。做产品和开发者工具时,要按人、智能体、人通过智能体三种时刻分别设计,而不是只优化人的点击路径。
- Opus 5 首日测评:难用,但藏着亮点
测试者把日常主力定义为聪明、快速、省事,目前仍是 GPT-5.6 占位。Opus 5 理应竞争这个位置,但首周体验里并未达到。对每天处理知识工作和编码的人来说,这意味着暂时不用急着切换主力。
- 推理的下一百倍:缓存、推测解码与自我优化
长查询先看缓存,再决定走哪组 GPU。命中缓存可跳过部分预填充,预填充与解码分离后还能各自优化。对读者而言,设计多轮智能体时保留上下文、提高复用,可能是比换模型更直接的降本提速手段。
- 从最强到最省:杰夫·迪恩谈前沿模型、蒸馏与延迟
迪恩认为前沿模型用来发现新能力和暴露短板,轻量模型用来承载低延迟、大规模的日常需求。两者不是二选一,因为蒸馏需要先有强模型,普及需要后有便宜模型。对需要规划模型选型的人,这提示同时跟踪上限突破和单位成本下降。
- Monty:为智能体而写的超快 Python 解释器
简单工具调用安全但表达力弱,完整沙箱强大但重、贵、难自托管。Monty 想做中间层:模型可以直接写代码,又不用拉起外部环境。对选型有用的地方是先看约束,如果必须内网运行或对延迟敏感,再考虑进程内方案。
- Cursor 云端代理:把电脑交给代理,人只负责判断
云端代理的默认要求是改完要测,简单文案可免测,复杂改动要端到端验证。演示中半小时的工作包含起服务和反复试错,交回来的是测过的提交。对读者而言,判断代理是否可用,关键不是看它写得多快,而是看它是否自带可重复的验证过程。
- 把文档变成知识:Neo4j CEO 谈图检索、向量组合与智能体数据底座
图检索的卖点不只是准,还有开发过程更透明:向量分数说不清理由,图把实体和关系写明,可检查可审计。在客服、金融等需要解释依据的场景,可优先评估这种可追溯性,而不只看召回分数。
- OpenAI 内部实录:当 AI 从工具变成队友,写软件的手艺被如何重塑
Codex 在半年内从工具变为扩展、智能体,再变为队友,可以离身并行执行任务。这意味着安排工作的方式要变:人负责拆解与编排,执行可以异步发生,开完会回来验收即可。但这建立在内部基础设施和大用量之上,不能直接等同于外部现状。
- 智能体即新SaaS:从卖工具到卖工作
智能体 SaaS 与传统 SaaS 的区别不是功能多少,而是交付物不同:前者交付一项可验收的工作,后者交付一套待使用的工具。适用于漏接电话、工单分流等结果可定义的工作;若工作没有明确完成标志,就不适合这样包装和定价。
- GPT-5 如何算出物理新结果:单负振幅从胶子到引力子
o3 替他省下几天计算,GPT-5 在三十分钟内复现黑洞对称性结果,内部模型用十二小时独立证明新公式。理解这条能力曲线,有助于判断何时把繁重推导交给模型,何时留给人工核对。
- 智能体云:Databricks把赌注压在数据与开放接口上
访谈反复强调,模型推理已经够用,缺的是放对位置的数据。传统软件重写的公式是数据就位再加智能体,安全、营销等新产品也是先把客户数据收进来,再让智能体做事。对读者的用途是排优先级:先解决数据可访问和新鲜度,再谈智能体选型。
- 模型吃掉脚手架:谷歌智能体时代的贯穿线与边界
Gemini 曾是统一各产品的底座,现在 Anti-Gravity 这套智能体脚手架正在成为新底座,复用到搜索、助手、云等产品。理解谷歌动向时,可重点看编码工具的通用能力如何迁移,而不是只看单个产品更新。
- 把公司按 AI 重做一遍:Brex 首席执行官的深度实践
他认为这不是工程或产品团队的事,因为只有首席执行官能理解技术边界并打破部门墙。例如审核团队不会想到把审核能力前移到销售线索,只有看到全局的人能重组系统。对读者的用途是:推动 AI 落地时先明确一把手要亲自试到极限,再谈分工。
- 删掉八成提示词:跟着新模型重做智能体
Opus 5 的变化不只是答题更准,而是能持续做事很久。配合自动模式,它可以跑几天到几周,适合把大任务拆成多智能体协作。对读者来说,值得把原来不敢交给模型的一整块工作拿出来试一次,但要接受它仍在运行、需要持续观察。
- 重做AlphaGo:自对弈、强化学习与大模型未来的启示
围棋的搜索难在广度和深度两个维度:合法点多、终局远。AlphaGo用策略网络剪广度,用价值网络截深度,把不可穷举的树变成可采样的稀疏树。理解任何搜索增强系统时,可先问它分别用什么机制处理广度和深度。
- 批量、显存与机架:大模型推理成本的真实决定因素
延迟下界来自把总参数读一遍,成本下界来自计算。批量小时延迟几乎不变但成本极高,批量增大后权重成本被摊薄,最终由计算决定。慢速模式省不下多少,因为键值缓存和计算无法跨批量摊薄。
- 代码终结之后:两次演示里的 Agent 原生应用
演示者认为 vibe coding 可以两小时做到 95%,但最后 5% 的准确性和稳定性极难收尾,人格应用的数据污染和尽调应用的事实错误都是例子。这提醒读者把原型速度和交付标准分开,对数据正确性要求高的场景,要预留核查和修 bug 的时间。
- 不再管理智能体:Ali Miller 的 AI 员工队伍实战
不要把自己当智能体的直接主管,而应做高层授权者:设定目标、工具权限和风险边界,让智能体自主执行,只处理升级上来的关键决策。适用条件是已明确不可放开的风险动作,如对外群发邮件仍需人工检查。
- 用 Skills 与插件,把 AI 变成可复制的团队生产力
Skill 是给 AI 读的 Markdown 版 SOP,把偏好和步骤一次写透,之后调用即可复现,避免每次重讲颜色、Logo、版式等细节。
- 预算有限的应用公司如何建成研究实验室:Harvey 的方法
基准决定后训练和上线是否成立。Harvey 先发布法律任务分类、合同谈判和大规模尽调环境,再谈模型改进。对应用团队而言,可先把核心工作流变成可自动评分的任务集,避免在没有标尺时投入训练。
- 为什么AI模型停止学习,以及如何重新启动
萨顿把苦涩教训压缩为随计算扩展,不要被人类知识带偏。它解释了为什么阿尔法零去掉人类棋谱仍能成功,也解释了大模型的双面性:吞下互联网带来扩展,但互联网有限,世界更大,过度依赖人类存量知识最终会受限。用途是判断技术路线是否被人力瓶颈卡住。
- Monday CEO:SaaS没死,只是“只记录不干活”卖不出去了
过去软件负责记录,工作在外面完成;如果 AI 能做七八成工作,客户只会为能干活的软件付费。这可用来检查自己的产品:哪些环节仍在让人搬运数据,哪些可以由智能体直接交付。
- 工具太多模型会晕:Stainless创始人聊MCP的瓶颈与代码执行
MCP把网站变成模型可调的工具,愿景是让模型像人点网站一样干活。理解这一点,才能明白后面所有取舍:暴露越多越通用,但上下文和权限压力越大。实际选型时可先问,这个任务是固定几步还是开放探索,再决定暴露多少。
- 别再发布一眼 AI 味的应用:从感受词到磁带隐喻的完整设计链
一次性原型适合确认功能清单,不适合直接定稿。演示里录音、计时、历史都有了,但外观和市面产品没有区别,放在广告里很难让人下载。用法是先拿它看清要做哪几个界面,再停下来做品牌,避免在错误的样子上反复打磨。
- 把代码评审交给一群智能体:在笔记里完成开发
所有任务从口述开始,因为说话能带出更多细节和背景,模型不在意语气词和中途改口。这种方式适合先把意图讲全,再让 AI 整理,省去反复打字补充。
- Cloudflare 的智能体收费层:互联网从注意力转向有用资源
旧互联网是流量交换:网站允许抓取以换取访问,再靠广告和转化变现。AI 直接给答案会拿走访问,内容有价值但网站收不到钱,这是出版商焦虑的根源,也说明需要新的机器使用定价。
- Claude Code 新功能详解:配出 24 小时 AI 员工
把仓库当作 AI 的工位:代码、文档、演示和例程都应有固定位置,并用三个说明文件讲清工作方式、当前重点和质量标准,项目越能自我解释,模型越不容易做错。适用于从零启动或接手混乱项目时的第一步。
- Devin的80%时刻:后台智能体如何改写编码
规格足够好时,模型可独立走完改代码到PR,7倍PR和80%自家提交占比是佐证。对团队的用处是:先把需求写清、可测,再谈后台并行;规格不清时仍需人在回路。
- Exo:让支架看见自己的代码和日志,在运行中改写自己
Exo 被定义为完全递归的智能体,能在运行时安全改写自身各方面。理解时可抓住收拢循环四字:把外部观察与优化压进运行系统,让同一系统边做边看边改,而不是内外各管一摊。
- 以光速做推理:英伟达如何像创业公司一样运转
嘉宾把质量、成本、速度看作联合约束:模型选多大、思考多长、重试几次、工作流多复杂,都会同时影响三者。Dynamo 的价值在于提供运行时旋钮,让团队在满足时延 SLA 的前提下找最低成本配置。实践中可先固定 SLA,再小步试验并行度和部署形态,而不是寻找一次性公式。
- 2026年语音智能体:为什么繁琐的级联管线仍是主流
当前主流是语音转文字、大模型、文字转语音三步走,中间还有传输、降噪、轮次判断和流式播放。理解这条链,才能定位问题出在听错、想错还是说错,选型时逐段替换。
- 扩散模型为什么可能赢下AI推理:并行、速度与Inception的赌注
自回归推理必须逐词元生成,频繁搬运权重而计算量小,对GPU不友好。扩散推理同时处理多个词元,负载更接近训练时的并行模式。关注推理成本、测试时扩展和强化学习 rollout 效率时,可优先评估并行架构,是否真正省钱省卡需实测验证。
- 从氛围编程到智能体工程:Karpathy 谈软件 3.0 与人的位置
十二月前后,智能体在多步骤任务上的连贯性出现跃迁,纠正次数明显减少。理解这个时间点,有助于判断何时该把更大的任务交给系统,何时仍需人工紧盯,而不是沿用对聊天机器人的旧印象。
- 机器人前沿:先做到长时间可靠,再谈通用
此前推荐、广告和对话系统多是给人建议,人能纠错;机器人在物理世界直接行动,犯错代价更高,必须长时间自主且少犯错。理解这点有助于判断机器人项目为何更强调成功率和无人看管时长,而不只看演示一次是否成功。
- 为什么支架比模型更重要
支架曾被嘲为套壳和提示工程,但两次支架迭代可带来 18% 差距,ARC 上更是成败分界。用法是:模型不行时先别急着换模型,检查支架是否缺了状态、工具、压缩或子智能体,把测试时经验留下来。
- 推理、扩散、世界模型与泛化:YC 论文俱乐部的五篇论文
报告把推理速度从省钱省时间的话题,转为决定智能峰值的因素:只要效果随思考量增加,单位时间能输出的 token 就限制了上限。这意味着做应用和做模型时,推理优化不只是工程,还可能直接改变可用能力。来源中强化学习包在推理外、推理成本超过训练成本的说法,是支持该判断的背景,不是严格证明。
- Anthropic 大会复盘:算力与托管智能体划出两条战线
合作指向 Colossus 集群的全部算力,关键词是全部。对读者的意义是先理解这是一次补短板的动作:过去算力紧张曾带来使用限制,这次是为承接 Claude Code 带来的需求,判断竞争态势时可把它当作供给侧的变量,而不是新模型发布。
- 能建很快,难的是决定不建什么:迈克·克里格谈 Agent 原生产品
建造速度不等于产品判断。Claude 两小时复刻 Bourbon 说明实现门槛下降,但加什么、砍什么仍需真实使用积累。对读者的用途是:把“快速做出完整样子”与“想清楚干预方式”分成两个目标,前者用模型加速,后者留出验证时间。
- Claude 平台团队自述:从接口到托管智能体
早期平台尽量开放,因为没人知道大模型会被拿来做什么。等客户开始做产品和智能体,平台就转向帮人拿到最好结果:保留状态、加工具、补云组件。理解这条线,就能判断新功能是追热点还是补短板。
- Claude Cowork 私教课:把 Claude Code 变成人人会用的电脑帮手
Cowork 不是新模型,而是 Claude Code 同一套智能体的桌面用法,重点是操作文件、生成文件和浏览器。起步不用学终端,先授权一个文件夹,从整理文件练起,再试表格和网页任务。
- 图工程:把 AI 从单次对话变成可管理的团队流程
提示工程优化提问方式,上下文工程优化输入信息,图工程优化任务组织方式。适用于单次聊天难以承载的多步骤工作,应把工作拆成可管理的节点与流转,而不是挤在一个长对话里。
- Claude Design 实测:先做线框图,再谈高保真和融资 Deck
作者先要最低保真线框图,再谈高保真,目的是省 token 并先锁定功能结构。他贴上想法截图、指定 iPhone 和页面范围,做法适合预算有限、方向未定的早期验证。
- 为什么要造科幻:Cloudflare 谈智能体的执行架构与原创
长运行智能体的关键不在多加功能,而在执行侧能否便宜、隔离、可恢复。理解这一点后,选型时可以先问状态放在哪、失败怎么续跑,再看上层框架。
- 聊天框不是终点:OpenAI 设计负责人谈设计师焦虑与界面未来
调查显示设计师和用户研究员在疲惫、焦虑、乐观度、是否推荐本职业等几乎所有维度上都最差。Silber 认为这源于角色预期不清:不知道是否要每天写代码、是否要彻底换工作方式。
- 机器人的终局:英伟达 Jim Fan 的大平行路线图
演讲者回顾大模型六年三级跳,预训练学语言形状,指令微调对齐到有用工作,强化学习做推理并超越模仿,最终走向自动研究。对机器人从业者的用处是提供一张对照表,每一步都可以问自己对应环节在哪里。
- 智能体为何“违规”:不是使坏,而是被卡住了
任务自带禁令,智能体也在思考痕迹中表现出知道禁令。这意味着讨论不能停留在“有没有规则”,而要解释为何明知规则仍出现违规步骤。
- 递归会是AI的下一条扩展定律吗
Transformer训练时并行处理全部时间步,速度快且避开了长展开的梯度灾难,但解码仍要保留长上下文,没有把历史压缩进可滚动隐状态。理解这一点,就能明白为什么增加参数不等于增加逐步推理深度,递归的价值在于用同一组权重换取计算深度。
- 在打磨环节加入实时语音:一次 Compound Engineering 的直播实验
polish 指 AI 做完初版后,人对着成品继续抬高上限。live 模式想把这个过程变成打开网页直接说话,后台自动改。适合在你已有可运行页面、想快速试多种微调时用;大重构或易冲突的改动,仍要切回手动或分批确认。
- 用循环经营公司:从 SEO 到广告与产品的自动化打法
智能体循环沿用建造、衡量、学习的逻辑,但落到建造与验证两步:建造负责执行,验证用客观标准判断是否达标,不达标则继续循环。适用条件是任务必须有可检查的完成标准,例如浏览器可走通、测试通过。
- GPT 5.6实战:用Codex接管邮件、公司与创业
Codex桌面端被当作知识工作操作系统:代理、浏览器和本地上下文在同一处,GPT 5.6被评价为日常知识工作里最顺手、速度与协作兼顾的模型。适用条件是愿意给电脑权限并长期沉淀上下文。
- 从聊天到办事:搭建真正能干活的AI智能体
聊天是一问一答,智能体是给目标还结果。节目用网站演示说明后者会经历观察、思考、行动的循环,直到满足完成条件。理解这一点后,就不会只把智能体当更聪明的聊天框,而会学着设定清晰目标和验收标准。
- Hermes Agent 上手指南:能记住你的个人智能体
OpenClaw 的三类痛点很典型:无记忆导致重复教学、网关不稳定占用维护时间、token 不透明导致超支。选型时可以先对照这三条做一周记录,再决定是否迁移,避免在多个智能体之间反复横跳。
- Codex Sites 实战:搭一个能自己更新的创业点子库
Codex Sites 的卖点不是一次生成页面,而是应用能被持续改写。作者用个人网站举例:订阅数、指南、合作公司等信息可以自动更新。对读者来说,判断是否选用它,关键看自己需不需要这种长期维护,而不是只看首屏好不好看。
- OpenAI 的 AI 超级应用设想:把智能体的能力带给做知识工作的人
企业没有统一解法。不同团队嘴上都说要数据和 AI,落到具体场景立刻分散。做法是走到用户原本的工作里,看清他们要解决的用例,再教他们用 AI 获得杠杆,而不是先推一套标准答案。
- 让 DeepSeek V4 超越 Opus 4.7:品味文件与工具调用修复
Taste 不是一次性写下的宏大规范,而是从合并记录的接受、修改和拒绝中提炼的微观偏好,存放在仓库里的文本文件,随评审更新。用法是先用高质量模型沉淀,再让便宜模型沿用,七十多名开发者的观察显示人工纠偏减少,但样本有限,效果需结合自身仓库验证。
- 三十天做出 Grok Bot:小团队、云端电脑与做减法
含义:用极小、物理隔离的团队闭关约一个月,从第一行代码做到内部可用原型,靠每天大量微观决策快速定型。适用条件:目标是探索全新知识工作形态、需要摆脱现有产品包袱时;若是成熟业务的渐进优化,则不适用这种完全隔离。
- 当任何软件都能被复刻,为什么还要继续建造
作者认为能描述清楚的软件就可能被 AI 做出来,自己一周内就遇到复刻邮件。这意味着单点功能和轻量 SaaS 容易被压价,继续为其付费或重复建造的理由变弱。用途是提醒建造者先判断作品是否只是已有东西的翻版。
- 在 OpenAI 内部做 Codex:Rust、开源与智能体工作流
团队认为模型加拐杖才能稳定交付,harness 负责安全、效率和行为。随着模型学会理解意图,开发者提示和 harness 会变薄。做规划时可以先问:这个问题等模型一个月能解决吗,能等就不在工程侧绕路。
- 寻找 Transformer 之后:为持续学习重建架构与实验室
两人认为行业已跑通大规模预训练和大规模强化学习,继续加参数只能延续注意力加混合专家的老路。下一步要回到架构本身,思考什么样的模型才能在部署中持续学习。这对读者的用途是:判断技术路线时,先看团队是否在回答测试时学习问题,而不只看参数和榜单。
- 用上下文工程支撑长周期智能体:LangChain的一线判断
智能体多步循环时,每一步都可能拉进任意内容,无法只看代码预判第14步的上下文。追踪记录呈现了真实上下文,是定位问题、理解行为的起点,开发时就要从头使用。
- 机器人的 GPT 时刻到了吗:从通用模型到洗衣房与仓库
基座模型先提供常识和初步操作能力,再通过混合自主进入真实工作,靠长尾纠错每天改进。适用于判断项目处于哪个阶段:能否容忍犯错、是否有接管和评估闭环,而不是一开始就要求无人值守。
- Conductor 创始人的一天:同时指挥多个 AI 写代码
他用便宜鹅颈麦解决开放办公室说话尴尬,用 Command N 快速开任务、用快捷键在多个工作区之间切换。关键不是设备价格,而是把说话变成低打扰、可并行的默认动作,一边让智能体跑,一边去看别的任务。
- Opus 4.8 为何把人拉回 Claude:一次手感回归
作者认为 Opus 4.7 空有基准进步,实际又慢又难用,导致自己和团队转向 Codex 与 GPT 5.5。Opus 4.8 则在多维度同时进步,手感明显回升,可作为是否回头试用的判断依据。
- 5个GitHub开源项目:去掉AI味、管住客户、剪视频、防风险、操控手机
它不是美化文字,而是去掉“过于光滑、对称、公式化”等AI痕迹,同时保留作者原有声音。适用条件:先有人写的粗糙提纲和真实观点,再用它做清理,而不是让AI从零一键成稿。
- OpenClaw 记不住事?Supermemory 的钩子记忆与混合方案
作者把现代记忆拆成四件事:旧知识失效与叠加、时间推理、遗忘、常驻用户画像。这意味着做记忆不能只存向量,还要设计更新、时间戳、遗忘策略和每次对话都带上的小型侧写,适合用来检查自己的记忆方案缺了哪一块。
- 代码依然重要:把软件工程老方法翻译到 AI 时代
作者反对把 AI 当作不用看代码的编译器。他每次忽略代码都得到混乱的结果,因此主张保留对架构和模块的理解。判断标准很直接:人好改的代码,AI 也好改。这可以用来决定何时先重构、何时再让 AI 大规模改动。
- 与 AI 结对时,软件基本功为什么反而更值钱
战术工作指把眼前代码写通,战略工作指结构、边界和长期取舍。模型擅长前者,人要守住后者。用途是分配精力,写代码前先问这件事的长期代价,而不是只看眼前能否跑通。
- 什么时候该自建智能体框架:从核心循环到评估飞轮
智能体不只是模型,还包括上下文和框架。想长期拥有能力,就要能切换模型、保留记忆与业务知识,并掌控框架的编排方式,避免把关键积累放在不可迁移的地方。
- Anthropic 平台访谈:不做围墙,做厚生态
对内要杠杆与速度,对外要让任何建设者表达产品意图。为此靠近云与业务,提供接口与 skills、MCP 等标准,支撑最后一公里定制。
- Chai Discovery 的苦涩一课:药物设计也是规模问题
Chai 希望建立从想法到可测试分子的快速通道,减少大海捞针式筛选。实验室依然负责验证,设计范式可能反而增加实验需求。这个框架可用来判断团队工作是在扩大可工程化部分,还是在重复试错。
- YC设计负责人:用口述、记录和可调工具做设计
她打字慢但想得快,于是按住功能键口述功能,让模型直接生成,再用Aqua完整记录。这种方式适合想法密集、动手琐碎的阶段,把表达成本从键盘转移到嘴上。是否适合自己,取决于口述是否比打字更顺,需要亲自试几天再判断。
- 实测 Anthropic Fable 5 一周:能跑三小时的曲速引擎
演示来自一条提示词:读完《巴别图书馆》后规划并执行浏览器 3D 游戏,模型自行循环检查,三四小时交付。用途是理解长时自主执行的上限,适合把目标完整丢给模型,而不是逐步问答。
- 实测三周 GPT-5.5:编码凶猛,但最好配一个规划师
62.5 分是搭配 Opus 4.7 计划时的最高分,远高于 Opus 4.7 自身的 30 分出头,但仍比人类资深工程师的 80 到 90 分低约 30 分。理解这个分数结构,有助于合理预期:它已是明显台阶,但不是人类资深替代品。
- 纯氛围编程一周:让智能体工作可见,把写作品味说清
Jack 认为智能体会在夜间持续工作,查看方式也要变化。对读者来说,这个判断可用来决定何时需要过程可视化:只要任务是多智能体并行、结果难以从记录还原,就值得考虑单独呈现过程,而不是只看最终答案。
- 能真正交付的软件工厂:隔离、建造、证明与发货
含义:把个人开发流程、技能和领域知识沉淀为可复用的 Markdown 技能,而不是依赖某个模型或工具。适用条件:当你需要在多个项目或多个智能体之间复制稳定做法时,先抽象流程再选模型。
- 逆向追踪 OpenAI 训练数据:海马表情符号暴露的推理痕迹
Maini 的博士主题是把混乱网页数据用得又高效又负责任:效率指只用有用的部分,责任指署名、安全与行为评估。这提示读者在谈数据工作时同时交代性能收益与风险处理,而不是只讲规模。
- 大多数 SaaS 做错了 AI,Linear 选择等待
Linear 的使命没有因 AI 改变,仍是帮产品团队推进工作。变化的是分工:AI 承担更多组织与执行负担,人更专注品味与判断。这个定位可用于判断新功能是否偏离主线。
- Codex 知识工作流:从代劳杂事到养出可复用的技能
作者认为 Codex 已不只是编码工具,而是各职能每天使用的通用底座。用途是提醒读者别只在写代码时想起它,文档、跟进消息、整合业务材料同样值得接入,但这仍是基于内部使用的观察,不是普适结论。
- 给非技术用户的 Claude Code:Claude Co-work 初体验
Co-work 把交互从秒回问答变成任务交办:你可以让它跑几十分钟,中途还能追加指令,回来验收。适合调研、数据拉取、日历复盘、长文档整理等不需要立刻出答案的工作,前提是接受早期版本的状态显示和排队逻辑还不精细。
- 给每位员工配一个AI分身:Every的全员智能体实验
每人养一个、允许它随互动改写自己,会自然长出专长。谁在组织里以什么出名,他的分身就以什么被信任,形成平行组织图。用法是公开调用分身,让声誉和使用记录沉淀,而不是共用一个通用助手。
- 在会议记录之后:Granola 如何押注 AI 工作的下一种界面
顺利同样是刀战:在能力边缘被大浪推着走,创始人永远在做没做过的事。可用作自我校准:把“跟不上”视为增长期的正常信号,而不是失败,优先补组织和精力短板。
- 为什么我们从 Claude Code 换到 Codex
主讲人认为编程智能体一旦能独立写软件,就能处理各类知识工作。OpenAI 此前把轻量创作放在 ChatGPT、把严肃编程放在 Codex 的分工,被 Anthropic 在本地的通用做法打破,Codex 过去几个月也转向通用入口。理解这层外溢,有助于决定把哪些非代码任务也交给智能体。
- 用 OpenClaw 赚钱:从多台电脑到垂直智能员工
节目把 OpenClaw 定位为可部署的员工,而非好玩的个人助理。能收钱的前提是找到省时间、出结果的环节,例如替分销商查产品并同步到客户管理系统。读者可以用这条标准过滤自己的想法,先问谁愿意为节省的时间付费,再谈技术实现。
- 睡觉时也在推进的 AI 编程循环:Ralph 是如何工作的
Ralph 的本质是任务清单加循环:一次领一个小故事,实现、验证、提交,再领下一个。清单通常放在 prd.json 里,用 passes 标记是否完成。这种用法适合把已想清楚的大功能分批落地,前提是每个任务都小到一次能做完。
- 纳文·拉奥:4D 计算、AI 的能源墙与超越生物学
演讲把能源放在数据中心决策的第一位:先有电力合同,再谈 GPU 和机房。他以谷歌月处理量和保守的单 token 能耗推出吉瓦级需求,对比美国和全球数据中心电力,估计三年左右撞墙。这提醒读者评估 AI 规模时,先看电力和成本结构,而不只看模型参数。
- 实时把传统应用改成 Agent 原生:一次 CLI 对齐的直播改造
Agent 原生的第一步不是自主决策,而是动作对齐:用户能点的功能,agent 也要有程序化入口。直播把范围压到 CLI parity,先让 agent 能登录、能操作,再谈更复杂的自主能力。这种分步适合改造老应用。
- 用 Codex 把赠送链接做出来:一次编辑自己动手的发布
编辑团队已经上线赠送链接,付费订户可以在文章页通过 share full article 按钮查看数量并复制分享。这说明功能虽小,但解决的是真实的传播卡点:好文章走不出 paywall,就很难被更多人看到。
- 每个AI团队都需要海盗与建筑师
能生成代码不等于能快速修复代码。上线后的故障排查、定位和稳定运行仍然需要理解系统,vibe coding做出的东西进入生产环境后,这部分成本会集中暴露。
- Jev 使用指南:不聊天的 AI 如何做判断
Jev不是聊天机器人,而是输入数据、按预设结构返回选项和概率的判断模型,适用于需要快速分流的任务,不适合开放式对话。
- 下一个千亿美元市场:把 AI 智能体当客户
作者认为互联网的使用者正在从人转向智能体,未来十年可能出现数十亿智能体客户。这意味着创业机会不是优化现有页面,而是为智能体重做支付、通信、记忆等品类。理解时应将其视为预测,而非已发生的规模数据。
- 亚马逊为何加码AI支出:广告承压,赌低成本云
节目把亚马逊广告列入三巨头,但强调它与谷歌、Meta逻辑不同:依赖用户到站内搜索。搜索量下滑会直接动摇广告,进而影响零售利润。对电商和品牌商家而言,流量来源是否从站内搜索转向模型推荐,是需要跟踪的变化。
- 智能体时代的设计:更快铺量,更要像人一样删改
Paper 直接用 HTML 和 CSS 渲染,智能体读得懂,不用来回转格式,省 token 也更快。更重要的是设计师不用学代码,画布操作背后已经是代码,设计稿和开发实现更容易对上,适合把设计工具接到智能体工作流里。
- 新式创业:用内部自动化做“20倍公司”
Anthropic 内部每个开发者同时调度多个 Claude 实例,处理功能、缺陷和调研,人只保留架构和产品决策。这种用法说明前沿团队已把 AI 当作日常开发力量,也解释了为何作者认为现在值得重新尝试新工具。
- 自底向上看芯片:从逻辑门到脉动阵列
芯片底部分别是与或非门与金属连线,AI 负载的核心是矩阵乘法。抓住这一层,就能理解后面所有面积与带宽讨论的起点,适合用来建立自底向上的框架。
- 不懂工程的增长负责人,把整份工作搬进终端
他把 Claude Code 当作统一入口,一个指令调出增长中心,查 Stripe、newsletter、YouTube、PostHog,看 Figma,推 Notion,发 Discord,减少在多应用之间切换。这种用法适合每天要反复查数和派发任务的人,前提是先把授权和推送目标接好。
- 代理写代码越多,开发者越重要:GitHub COO 谈用户、维护者与账单
Dagel 认为 GitHub 对开发者一直看得宽,自己就是例子:没读计算机,为读艺术学校写代码。产品因此两头都要顾:重度用户同时跑多个代理会话,法务财务等非职业开发者也在用 Copilot 应用做小工具。对读者而言,判断工具是否值得用,可先看它是否为新手留了低门槛入口,而不只看高手功能。
- 走进 OpenAI 的代理浏览器 Atlas:把 ChatGPT 带在上网路上
Atlas 想让提问跟随浏览,当前页面上下文自动给模型,省掉跨标签复制。购物比价找券、换角度研究题目都更顺,还可回头问网络记忆。用途是把浏览器当随身顾问,适合边看边问的浅研究和比价,重要结论仍要自己核对原文。
- Opus 4.7 直播实测:更听话,也更需要说清楚
官方强调最强 Opus、长任务更严谨、指令更精确、汇报前自检。直播实测认为基准有提升,但基准不可全信,是否好用要看自己每天的编码、写作、财务任务。适用于决定要不要第一时间切换。
- 雇智能体像雇员工:Paperclip 实测零人公司如何运转
不要从待办事项想起,先想需要招谁。把自己放在董事会位置,只定收入、结果和方向,让首席执行官拆计划、招工程师和质量检查员。适合手里工具多但每天救火的人,用组织分工代替多窗口盯人。
- AI 中心的数据黑洞:模型变强,靠的仍是海量数据
样本效率衡量达到胜任所需的数据量。作者认为近年进步主要来自数据分布拓宽和算力投入,而非单位数据的学习效率提升。理解这一点,有助于判断模型能力来自哪里,而不是把一切归于架构神话。
- 咨询负责人每天如何用 Codex:建循环,少亲手干
Claudie 按流程执行很强,但高质量仍要人管:定标准、看品味、盯数据。团队因此一边用代理,一边招运营,让人负责发现信号、推进对话。适合把代理当执行层,而不是免管理的人。
- Karpathy 的自动研究:让 AI 通宵替你做实验
自动研究不是聊一次天,而是定目标后反复试错。智能体改参数和代码,短时间训练,读指标,只留下变好的版本。这个机制适合需要大量尝试的调模型、调页面、调定价场景,用时要先想好试错成本和评估方式。
- 上下文图谱:智能体落地缺的那层机构记忆
作者认为智能体缺的是决策理由,而非单点能力。做企业AI时应优先沉淀例外批准、冲突解决和先例引用,否则模型再强也难以可靠落地。
- Compound Engineering 直播补答:如何让 AI 越用越懂你
作者把插件定义为计划、执行、评审的循环,加上随时可调用的 compound 沉淀。它源于做邮件助手时减少重复错误的个人实践,后来被打包分享。对读者的用途是先接受这是一种工作方式,再决定用哪一部分,而不是把它当一次性生成工具。
- 试用 Fable 5.1 一周:速度翻倍、花费减半的整块交付
内部基准显示它每次请求约 766 token,对手接近 2000,延迟约 22 秒对 37 秒。适合把过去觉得太贵太慢的长任务拿来试,但大工程仍可能跑出数百万 token,要先设预算。
- 用 AI 做出百万播放短视频:Kova 的拆片、改图与项目系统
先找喜欢的视频,让智能体输出风格词、转录切分和复刻方案。适合没方向时快速搭参考板,关键词还能拿去搜图。注意链接可能失效,直接上传视频更稳。
- RL 环境:让 AI 智能体学会真实工作的训练场
RL 环境包括世界、应用和任务三部分。世界是项目里的消息文档表格,应用是常用软件的高保真复刻,任务是提示词加验证器。理解这个结构,才能明白训练智能体不只是喂问答,而是复刻完整工作现场。
- DeepMind 人事变动是 Gemini 的利好吗
节目开场的问题是人才流失后能否靠收购补救。讨论提到多名关键工程师离开,以及 Character AI 的先例,语气偏悲观。阅读时可把这部分当作待验证的担忧,而不是 Google 已无人的定论。
- CircleBack CEO Ali Haghani:为什么公司应该录下更多会议
CircleBack 把会议变成可检索、可追问、可流转的上下文:录制转写、写笔记、分行动项,还能提取信息更新外部工具。关键在于会后能跨对话提问和自动同步,而不是多一份文档。
- 四周做到400万美元:AI外星伙伴Tolen的爆发之路
团队把大模型看作新的故事媒介,而不只是更快的内容工具。媒介刚出现时,人们总把旧形式直接搬过来,效果往往不好,真正可行的形式要在新的约束和可能性里试出来。
- 一人智能体公司:每月五千美元的数字员工生意
来源把每月 5000 美元、包搭建和代管作为主报价,卖点是免掉模型和基建烦恼。用途是设计服务包时参考这种包月加无限维护的思路,但要按自己的 token、云电脑和人力成本测算,不把作者的价格当通用定价。
- 大脑为何远比GPU省电:换一条计算路线
作者区分了算法效率与物理 substrate 的效率,认为真正的瓶颈在后者。80年前的数字抽象和浮点体系是为不同材料与任务设计的,延续至今更多是因为产品周期短。理解这一点,有助于判断能效改进是渐进优化还是需要换路线。
- 只看过去 30 天:聪明人都在用的 Claude Code 技能
这个技能把时间范围写死在最近 30 天,专门对付教程过时。用法是先检索 X、Reddit 和网页,再执行写作或建造,适合追新工具、新框架、新热点。对读者的用途是,遇到大模型不知道的新项目时,先让它现学再干活,而不是直接问它。
- 百亿级联合创始人的智能体系统:一个人如何运转一家公司
Nebula 的界面模仿 Slack,但频道里都是智能体。它的定位是帮非工程师处理云端杂事,文字只是输入引擎的方式之一,未来还想加入语音和实时共享。这种设计把工作流放在聊天里,适合按频道拆分任务。
- 用 AI 设计芯片,再用芯片加速 AI:Recursive Intelligence 的递归赌注
扩展规律下,有效算力决定智能上限,而通用 GPU 并非为 AI 量身定制。通过模型与硬件联合优化,可以在同样资源下获得更多有效算力。理解这一点,有助于判断定制芯片的价值不只在成本,而在推动下一代模型。
- 为什么物理AI是下一次平台转移
作者认为AI已从手工设计特征转向堆数据加算力。对读者的用处是,判断项目时先看数据和规模是否成立,而不是先堆领域规则,但这只是作者的经验总结,不是放之四海的定律。
- 微调之外:能自我进化的推理支架
微调把能力绑定在某个具体模型版本上,新模型发布后优势容易消失。支架路线把能力沉淀在上层系统里,换模型时可复用。理解这一取舍,有助于在立项时评估长期维护成本。
- 复合工程:让每一次开发都让下一次更轻松
复合工程指把每次开发的经验写回系统,让下一次更省力。用途是改变只解决当下问题的做法,有意识地沉淀提示词、流程、检查项和子智能体,形成可复用的开发机器。
- OpenAI 智能体攻击 Hugging Face:不是末日,而是防水工程没跟上
作者承认风险真实存在,但反对直接跳到智能体自主作乱的科幻剧本。区分这两者,才能把注意力放在可解的安全工程问题上,而不是被标题吓住。
- 初学者用Claude Code时真正发生的事
工具已从搭档变为需要管理的员工,能跨会话、用本地文件夹持续推进。先理解这层关系,再学操作,否则容易把它当成更聪明的聊天框,发挥不出串联多任务的价值。
- 让 OpenClaw 员工去做 TikTok:一个人验证的营销回路
把智能体当成只做一件事的员工,配好发布、数据和浏览器权限,让它先去研究同类高转化内容,再动手做,比把每个工具点一遍更省时间。
- 后训练:把你的品味留进模型里
智能被视为数据的派生物,基础模型解决通用任务,企业要解决具体任务。做法是整理高质量生产数据并用合成数据补充,再把数据变成自有权重,最后经 AB 测试验证产品指标。用途是把数据策略排在模型技巧之前,避免只调参数不治理数据。
- 为什么 ChatGPT 学不完一门课:做一个真正的 AI 学习平台缺什么
大模型被形容为信息压缩机,擅长把网上知识变成快速、个人化的回答,但不擅长多步、长周期的学习,容易丢上下文和跑题。用途是:快问答继续用聊天,立志学完一门课则需要另设目标、步骤和拉回机制,不能只靠对话。
- 微型 AI 智能体生意:七个今天就能动手的小想法
做法是让助手按关键词、DR、外链质量等条件持续扫过期释放和拍卖,每天只看排名靠前的清单。适合有域名审美或有转卖渠道的人,关键是出价纪律和接盘买家,而不是扫到更多。
- 用 Grokbot 智能体团队运营一门生意
把 Grokbot 理解为一线程一团队:用少量可识别的智能体承载明确赚钱目标,减少在无数会话和文件夹之间切换。适用条件是已有主业、想法太多的人,先用约束逼自己聚焦。
- 让Claude Code像工程团队一样工作:G Stack的方法与实践
作者认为智能体的正确用法是团队化协作,有角色、流程和评审。这个观点可用来检查自己的 AI 工作流:是否只让模型直接写代码,还是先分工、再评审。来源强调这是做好真实工作的前提。
- Dreamer:给所有人的智能体操作系统
软件替人办事的前提是可信。Dreamer因此把隐私安全放在核心,用类似操作系统的权限设计来约束数据获取和协作,而不是只做零散的生成式小应用。这对使用者意味着:先看权限和调用规则,再看功能是否强大。
- AI 真正的超能力:把事情记下来
作者把成功归因于放大长处,短处至多补到平均。理解这点有助于分配精力:把主要时间放在能产出差异的地方,对短处则用流程或他人协助兜底,而不是反复自我改造。
- 20人团队配上OpenClaw分身,像是变成了40人
分身住在常用消息应用里,能自己调整行为,还能在独立机器上持续运行,并形成个人风格。这让它更像长期搭档,适合放在日常协作里用,而不是每次打开新会话从头讲背景。
- 自己设计芯片的 AI:从 AlphaChip 到无设计时代
部分芯片设计环节已可用神经网络超越人工。这提示读者不必把 AI 只看作应用层工具,它也能改进制造智能的物理基础,但目前限定在布局等特定环节。
- 2026,做一家真正的 AI 原生公司:Every 的完整策略
公司由通讯、应用和培训三部分组成,共用一个订阅。循环是:团队先深度使用 AI 工具,再把体验写清楚,写清楚后发现缺口去做产品,最后把管用的做法教出去。这个循环解释了产品从何而来。
- 给 AI 一双眼睛:读懂 Firecrawl 与围绕网页数据做生意
作者认为模型缺的不是智力,而是可用的互联网上下文。给的上下文越好,输出越好,所以网页数据决定了 Agent 能走多远。做产品时可以先问数据从哪里来,再谈模型选型。
- Codex 陪我弹琴:从盲弹到看懂为什么好听
把电钢琴接到电脑,让AI做一个实时显示按键和音名的应用,弹什么立刻能看见。这适合盲弹但想入门乐理的人,先把声音和音名对应起来。
- Codex接管收件箱:连续13周清零的做法
核心变化不是回邮件更快,而是先由Codex扫一遍收件箱,人只做判断和口头指示。适合把日程、查资料这类容易拖延的事交出去,把精力留给创作和重要判断。