锐知 - 全球认知雷达

Every ·

实测三周 GPT-5.5:编码凶猛,但最好配一个规划师

62.5 分是搭配 Opus 4.7 计划时的最高分,远高于 Opus 4.7 自身的 30 分出头,但仍比人类资深工程师的 80 到 90 分低约 30 分。理解这个分数结构,有助于合理预期:它已是明显台阶,但不是人类资深替代品。

这是一次发布日实测。团队在内部用了 Spud GPT-5.5 约三周,覆盖编码、写作和知识工作,结论是能力有明显台阶,而变化最大的是编码。 资深工程师基准:62.5 分的含金量 作者自创了一个资深工程师基准,做法是给模型一个“氛围编程”写出的杂乱代码库。这个代码库来自他自己做的应用 Proof,要求模型从第一性原理重写,看它能否写出概念清晰、像资深工程师经手过的结构。 评分标准是两名真实资深工程师的重写版本。人类资深工程师在这个基准上稳定拿到 80 到 90 分,说明基准远未

来源:youtube 原始内容