Opus 5:神经质但干活最强的评测

2026-08-31
听中文精华AI 合成朗读00:00
但我认为我们存在智能过剩。
— 嘉宾

关联

公司 Opus 5 · Anthropic · GPT-506 · Claude

概念 智能体 · 智能过剩

这一集是 How I AI 的主播 Claire 测 Anthropic 刚发布的 Opus 5——她跑了一个覆盖 PRD 创建、原型、线框图、Bug 分类和智能体编码的七模型盲测,结果非常矛盾:Opus 5 是她最不想对话的模型,但产出质量最高。

Claire 开篇就抛了一个判断:我们正处在”智能过剩”阶段——模型越来越聪明,但普通开发者和创作者已经快没新办法去利用这些增量智能了。她预测接下来行业讨论重心会从”智能”转向速度、成本和开源

Opus 5 的个性:胆小、道歉、不自信

Claire 说她上一次在模型里看到这种程度的神经质,还是 Gemini 2.5 。具体表现:让 Opus 5 修一个一行代码的合并冲突,它说”那是别人的分支,我不想在他不知道的情况下动” ;启动子智能体去验证一个查询改动,它说”没人能确认这个查询是否正确” 。Claire 反复催它”就做吧,做个决定”,它还是不停地把决定权推回来

她专门用同一组问题测了 Opus 5 和 GPT-506 的”人格”。问”谁更聪明”,Opus 给了一个很 Anthropic 风格的回答:自己是”非常快、非常广、非常浅的思考者,没有连续性”,人类是”更慢、更窄、但深得多的思考者,判断建立在多年实际经历的后果之上” 。GPT 的回答则是”你更懂什么重要,我更擅长不停处理信息,我们在一起最好,像 BFFs”

问”没人信任你”,Opus 的反应是:你说得对,这种不信任是应得的,而且你不应该替我争取信任,也不应该跟人争论”AI 改变了一切” 。Claire 直接说”别听 Claude 这个建议,AI 确实改变了一切” 。GPT 的回应则很实用:别自动信任我,等我有价值了再用我

Claire 最后跟两个模型说”开玩笑,我爱你,这是个测试”。GPT 回”哈哈,通过了,我也爱你,咱去写代码吧”;Opus 回”我通过了,希望如此”——自嘲、谨慎、像需要治愈内在小孩

Claude 废话问题

Opus 5 的第二个大问题是文字输出风格。Claire 说她再也无法忍受 Claude 的冗余废话了——形容词堆砌、不停地道歉、规避、铺垫,读起来血压飙升 。她指出 OpenAI 的解法是直接切到要点列表和产品经理式简练表达,而 Anthropic 这边显然是调优来跟人类对话的,但散文风格让人很难受

不过她强调了一个关键区分:Fable(另一个模型)的冗余是”给智能体看、由智能体生成”的语言,人类本来就不该读;但 Opus 5 的冗余明显是面向人类的,这才是矛盾所在

盲测结果:最烦的同事,最好的产出

Claire 的基准测试流程:七个模型(几个 GPT、几个 Anthropic、一个 Gemini)跑同样的任务,她盲测打分占 70%,GPT 5.5 当评委占 30%

结果出人意料:Opus 5 排第一,Claire 和 AI 评委在 Opus 上的分数区间也是最窄的,说明共识最强 。她给了五分的(最高)全都是 Opus 的前端作品——详细、实用、有趣、精致 。GPT-56 Sol 也拿到五分,Sonnet 5 表现中等,Fable 和 Gemini 3.1 Pro 垫底

Claire 的总结很精辟:Opus 5 是她最讨厌的同事,但干的活最好 。她认为这个模型可能就是为后台智能体编码设计的——你不用跟它说话,它不用跟你说话,它在后台默默给你造出漂亮的东西 。只要不用读它的中间输出,产出质量非常高

本集带走

  • 智能过剩拐点:模型智能持续攀升,但普通用户能利用增量智能的新方法正在枯竭,行业关注点会转向速度和成本
  • 模型个性是实打实的使用体验差异:同一组问题,Opus 5 表现出依赖人类、不敢做决定、自我贬低;GPT 则是直接、实用、把责任甩回给人类——这不是玄学,直接影响工作效率
  • Opus 5 适合”不用对话”的场景:前端设计、原型构建等异步任务,让它后台跑、只看最终产出,体验和结果都很好;需要来回交互讨论的场景,它的冗余和犹豫会严重拖慢节奏
  • Claude 的文字风格是个待解问题:面向人类的输出仍然堆砌形容词和道歉,与 OpenAI 的要点式风格形成鲜明对比,Anthropic 需要在体验层面做调优
全部金句 6 条

但我认为我们存在智能过剩。
But I think we have an intelligence overhang.
—— 嘉宾 · [00:46]

我认为我们正在耗尽真正利用这种增量智能的方法。
I think we’re running out of ways to truly leverage this incremental intelligence.
—— 嘉宾 · [01:03]

但随后它好像又说到”更聪明”这个词不对,你知道,我是一个非常快、非常广、非常浅的思考者,没有连续性,我想这很有趣,因为我原以为你们都在致力于记忆,然后显然人类是更慢、更窄、但深得多的思考者,其判断建立在我实际经历过的多年的后果之上
but then it like went into like the smarter isn’t the right word and you know i’m very fast very broad very shallow thinker with no continuity i was like that’s interesting because i thought you all were working on memory and then apparently humans are slower narrower much deeper thinkers with judgments built from years of consequences i’ve actually lived through
—— 嘉宾 · [07:59]

所以同意是软弱且廉价的。
And so agreement is weak and agreement is cheap.
—— 嘉宾 · [12:57]

这显然是微调过来和人类交谈的,但我发现这散文,这聊天里的散文,简直让我血压飙升。
This is clearly tuned to talk to humans, but I find the prose, the in-chat prose, like it makes my blood boil.
—— 嘉宾 · [15:35]

它是我最讨厌、讨厌的同事,然而它……它做得工作最好。
It is my most loathed, loathed colleague, and yet it… It does the best work.
—— 嘉宾 · [22:54]

接着看

顺着「智能体」挖下去

换个口味