Anthropic 构建生产级智能体的教训:harness 须为模型能力演进而生

Gagan Bhat · 2026-08-12
听中文精华AI 合成朗读00:00
当模型演进而安全带不变时,它会拖累智能体的表现。
— Isabella Kai He

关联

当 Sonnet 4.5 发布时,它表现出一种「上下文焦虑」——还没到上下文窗口极限就提前草草结束任务。于是开发团队给系统的「安全带(harness,指围绕模型构建的外部控制框架,如循环、工具调用逻辑等)」加了上下文重置功能来打补丁。

但 Opus 4.5 一出,这种焦虑完全消失了,原本的修复不仅成了累赘,还导致延迟增加和缓存错误。**这说明了一个核心教训:当模型进步了而安全带不跟着变,安全带就会拖累智能体的表现。**这是 Anthropic 应用 AI 团队打造 Claude Managed Agents(一种由 Anthropic 托管的智能体基础设施服务)时最深刻的洞察之一

过去三年,构建智能体的方式经历了三次演变。最早只有 Messages API(tokens 进、tokens 出);后来团队开始手搓「智能体循环(让模型不断调用工具、获取结果、再推理的闭环)」,但除了循环,还要处理会话管理、凭证、沙箱(隔离代码运行的安全环境)等繁琐的生产基础设施;再后来有了 Agent SDK(打包了内置循环和基础工具的软件开发工具包),省去了手搓循环,但托管和凭证仍要自己做 。Claude Managed Agents 则把一个生产级智能体需要的基础设施——智能体循环、托管、会话管理、可观测性——全部由 Anthropic 托管,让开发者只需专注自己的产品、任务逻辑和领域知识

为模型演进而设计

要构建一个有效的安全带,你必须为明天的模型能力做设计,预测未来的模型能做什么,并让架构足够敏捷,以便在能力就绪后快速捕获 。Claude Managed Agents 围绕一小组独立、可替换的原语来设计,这样既能随着模型快速迭代各个组件,又能保持整体架构稳定。

最核心的架构决策,是将智能体的「大脑」(模型推理与智能体循环)与「双手」(工具执行沙箱)解耦 。团队最初把循环和工具执行放在同一个容器里,但这带来了灾难性的可靠性问题:只要容器没完全启动好,模型就没法开始推理;而且容器里任何一部分出故障,整个智能体直接宕机。

解耦之后,系统获得了极强的韧性。如果沙箱意外死掉,处于独立位置的大脑可以直接起一个新的沙箱重试;如果大脑死掉了,它可以从持久化的会话日志中读取记录,精确恢复到中断的地方继续执行 。这意味着系统有了空闲、运行、重调度(遇错重试)、终止四种明确的会话状态,让智能体在跑数小时甚至数天的长周期任务时具备了生产级的可靠性

此外,解耦还带来了极大的性能提升。过去模型必须等容器完全设置好才能吐出第一个字;现在模型推理可以立刻开始,容器设置在后台并行跑,甚至如果任务不需要沙箱可以直接跳过。实测表明,这让中位用例的首字延迟快了 60%,而在 P95 用例中,首字延迟改善了 90% 以上

上下文工程:不丢失记忆的秘诀

在许多传统的框架实现中,上下文窗口和会话日志是同一个东西。这就导致了一个要命的问题:如果模型为了腾空间而丢弃了某段上下文,一旦它后面发现那段信息还有用,它是找不回来的

Managed Agents 解决这个问题的方法是:把每一次交互(用户消息、模型响应、工具执行结果)都作为事件持久化写入一个独立的会话日志(也可称为追踪 trace)中 。因为所有信息都在这份持久的日志里,模型如果编辑或丢弃了当前窗口里的某段上下文,它随时可以通过重新读取会话日志的切片来恢复它 。这份会话日志同时解决三个问题:在前端展示出来就是可观测性;读取过往历史就构成了记忆;配合「做梦(dreaming,一种离线批处理机制)」分析历史日志并提炼洞察,就能自动更新记忆,实现智能体的自我改进

把生产安全握在自己手里

在将智能体推向企业的过程中,团队学到了几个关键的生产实战教训:

首先是**凭证隔离**。企业极其担心模型会读到敏感的安全令牌。

通过将大脑和双手解耦,再加上「保险库(vaults,一种凭证存储机制)」,安全凭证只有在工具真正执行运行的那一刻才会被解密。模型本身永远无法看到这些令牌

其次是工具执行的隔离与控制。对于安全意识极强的团队,他们希望工具执行完全发生在自己的虚拟私有云里。

得益于解耦设计,「双手」可以跑在任何地方,团队据此推出了自托管沙箱(self-hosted sandboxes),让客户在自己的执行环境里完全贯彻自己的安全策略 。另一项功能 MCP 隧道(MCP tunnels)则允许企业的 MCP 服务器只运行在私有网络内,仅向 Claude 的智能体循环发出站调用,彻底避免在公网暴露服务

前沿探索:定义「成功」的智能体

展望未来,团队正在探索两个激动人心的前沿特性。除了前文提到的通过「做梦」实现组织级的记忆系统外,另一个重点是 outcomes(结果评估机制)

这是一种让智能体真正理解「任务成功意味着什么」的机制。开发者定义一套成功标准(评分表 rubric)和失败情况,outcomes 会启动一个独立的「评分智能体」(grader agent)与你的主智能体并行运行。如果评分智能体判定任务没达到标准,主智能体就会不断迭代尝试直到成功为止

随着模型能力呈指数级跃升,围绕在模型周围的静态框架(harness)已经成了限制模型发挥的瓶颈。Managed Agents 的目的就是消除这层摩擦,让产品能够真正捕获今天前沿模型能够达到的智力上限

本集带走

  • 为明天的模型做设计:安全带(框架)中那些「假设模型做不到某事」的补丁(如上下文重置)会随模型变强而变成拖累性能的死重;框架必须模块化、易替换,以便随模型演进而快速迭代。
  • 大脑和双手必须解耦:把模型推理与工具执行环境分进不同容器。如果沙箱挂了,大脑可以另起一个;如果大脑挂了,可以从持久化日志恢复;容器启动不再阻塞模型出字。
  • 用持久化会话日志做上下文工程:不要让上下文窗口等同于会话记录。把交互全量记在日志里,模型可以随时丢弃再从日志切回,既避免「上下文腐化」又支持可观测性。
  • 锁死凭证与网络:用「保险库」让安全令牌仅在工具执行的瞬间解密,模型全程不可见;利用自托管沙箱和 MCP 隧道,把工具执行和内部服务死死锁在自己的私有网络内。
  • 用「做梦」和 outcomes 迈向自改进:定期离线分析历史日志(做梦)以提炼洞察更新记忆;用定义好的成功标准驱动的并行评分智能体(outcomes)迫使主智能体不断重试直至真正达成目标。
全部金句 4 条

当模型演进而安全带不变时,它会拖累智能体的表现。
When the model moves and the harness doesn’t, it degrades the agent.
—— Isabella Kai He · [08:57]

安全带的修复程序不再被需要,并且实际上在 Opus 4.5 的模型性能中起反作用。
The harness fixes were no longer needed and were actually detracting from model performance with Opus 4.5.
—— Isabella Kai He · [08:49]

我们发现,随着模型演变得更有能力,如果你将逐字稿和记忆状态作为一个周期性批处理过程,并使用我们所谓的做梦,它允许我们提取新的洞察和新的组织结构,这基本上会反馈并编辑记忆,从而让第二天的智能体会话自动地变得更加智能。
What we found is that as models have evolved and become more capable, if you feed the transcripts and the memory state as a periodic batch process with what we call dreaming, it allows us to extract new insights and new organized structures that essentially feedback and edit the memory as needed to make the next day’s agent sessions automatically much more intelligent.
—— Gagan Bhat · [27:45]

我们看到 Claude 模型和其他模型本质上是沿着这个指数轨迹演变的,安全带已经成为模型能够实现什么的限制因素。
What we see as Claude models and other models essentially evolve alongside this exponential trajectory is that harnesses have become the limiting factor to what models can achieve.
—— Isabella Kai He · [30:22]

接着看

顺着「智能体」挖下去

换个口味