锐知 - 全球认知雷达

Every ·

Opus 4.7 直播实测:更听话,也更需要说清楚

官方强调最强 Opus、长任务更严谨、指令更精确、汇报前自检。直播实测认为基准有提升,但基准不可全信,是否好用要看自己每天的编码、写作、财务任务。适用于决定要不要第一时间切换。

Anthropic这次没有提供提前试用,团队只能直播实测Opus 4.7。官方说法是迄今最强的Opus:长任务更严谨、指令遵循更精确,还会在汇报前自行校验输出。最后一点比较新,相当于把优秀提示词里“先自查再回答”的习惯做进了模型。基准上,相比4.6在SWE-Bench Pro约涨10%,Verified约涨7%,提升明显,但仍不及Mythos。团队判断节奏很赶,上周刚有Mythos,这周又推4.7。 实测分多路并行:用复杂P&L生成3月投资者更新,考验财务分析加写作;测试写作

来源:youtube 原始内容