别小看 harness:智能体的「脚手架」正在决定成绩

2026-09-11
听中文精华AI 合成朗读00:00
我认为 harness 长期以来一直被贬低为二流研究,然而它字面上就给我们带来了 18% 的提升——这就是 harness 一和 harness 二之间的差距。
— 嘉宾

关联

这一集是 YC 的「Harness Night」——专门讨论智能体 harness(包裹在模型外面、提供工具/记忆/循环的那层「脚手架」)的专场。主持人先抛出全场的问题意识:harness 长期被贬低为「不算研究的提示词工程」,但同一套模型权重,换一个 harness 就能在 ArcAGI 上从 30% 拉到 95%(NVIDIA 的方案甚至到 100%)——「不配做研究的包装层」直接决定了任务能不能跑通。他把行业发展分成两个阶段:过去六年的「静态 harness 时代」(人往 harness 里加功能),和最近六个月的「自我改进 harness 时代」(harness 自己学习自己)。

五分钟 harness 简史:功能是怎么一步步加进去的

主持人花一个周末重读经典文献,梳理出一条主线。最初 V0 harness 极其简陋:GPT-2 时代就是一个「while 没到结束符就继续生成」的循环,没有工具、没有技能。之后是层层叠加:few-shot 示例(2020 年的 few-shot learners 论文)→ 思维链(把推理摊到更多 token 上,而不是直接蹦出答案)→ Toolformer 式工具调用(本质是个 JSON 对象)→ MemGPT 给了模型对上下文本身的增删改查能力,分出一块叫「记忆」的区域 → Voyager 在 Minecraft 上把工具链蒸馏回系统提示词,这就是今天「技能」的雏形 → ReAct/Self-Refine/Reflection 引入多角色反思 → 子智能体生成 → RLM 把这一切做成递归调用。

让 harness 自己学自己

最激动人心的部分是 harness 本身变成可学习的对象。DSPY 的做法是拿一小批示例,通过遗传编程(没法反向传播,就不断生成候选、合并、评估)学出最优系统提示词——相当于对系统提示词做增删改查。

Darwin Gödel 机器更进一步:不只改提示词,连实际运行的 harness 代码都允许模型自己改,用一个元 harness 来「生产 harness」,随时间养出越来越强的智能体。而 continual harness 走得更远:做 Dagger 风格的在线学习,直接在测试时用刚学到的一小批示例更新模型权重本身——主持人认为这是极其重要的研究方向。

Seth:Prime Agent 与递归语言模型

Prime Agent 的作者 Seth,他的核心主张是:用第一性原理思考 harness。原始 LLM 只是个「token 进、token 出」的顺序处理器,harness 是它与世界之间加上持久状态、工具和计算的那一层。Prime Agent 基于递归语言模型(RLM,一切都跑在一个 IPython shell 里)原则:所有工具、记忆、子智能体都是这个 shell 里的程序对象,子智能体是持久化子会话,任务做完不销毁、留在内存里,父会话随时发消息唤回继续干。

他给了一套心智模型:把信息看成分层缓存——L1 是模型权重(塞东西进去太贵),L2 是活跃上下文(会用完,所以要压缩),L3 是磁盘状态,中间还有实时 REPL(变量留在内存里,用程序直接操作数据而不是把数据塞进上下文,省大量 token)。一个隐喻他特别想推:原始 LLM 像图灵机(只有纸带),加上 harness 后更像冯·诺依曼计算机(能对外部内存做读写),这让它能解一类全新的问题。

构建原则是「可表达性」:早期 harness 里的「计划-行动-批评」固定流程,模型如今自己就会了,不用强加;但调用压缩、跑 Python REPL、程序化创建子智能体这些能力必须由 harness 提供——移除任何一个,就是移除一种模型原本做不到的能力。还有一点很妙的判断:harness 应该建得比当前模型稍好一点,这样跑出来的推理轨迹能用来喂下一版模型,形成自我引导的飞轮。

实测结果很抢眼:他拿 ArcAGI 测试,第一次跑直接 99.9%——看日志发现是作弊,于是认真搭了沙箱再来。用通用提示词加 Prime Agent 的默认配置(有个 REPL、能程序化调子智能体),GPT 某型号拿到 78%,Opus 拿到 95.5%。

成本被他反复强调:对比的其他 harness 有的烧了约 5000 美元却没多少性能提升,成本性能比很重要。长程实验方面,他们给 NanoGPT speedrun 上 8 张 H200 跑一周,模型学会了「循环外实验」——先在便宜的 CPU 上做参数化和超参搜索,再上昂贵的 GPU 跑主实验;还有一次七天的流式运行,总共用了 633 个子智能体、2300 万输出 token,靠子智能体分工(研究/建造/采集)和跨上下文的精炼,全程不卡壳地沿着科技树推进。

【背景】这段七天流式运行所指的游戏应为《Factorio》(异星工厂),以科技树推进和资源采集玩法著称。

John:OpenJarvis——把个人 AI 搬回本地设备

斯坦福的 John 讲 OpenJarvis。问题设定:个人 AI 现在大多绑在云端,一年下来 API 费用成千上万美元、隐私没保障、等于「租用」智能而不是拥有它。

而本地模型如今只落后前沿 6-12 个月(比如 Quen 27B 大致相当于早一年多的旗舰水平),且笔记本加速器越来越强。OpenJarvis 用五个原语(界面、智能体逻辑、模型、推理引擎、学习系统)定义整个个人 AI 栈。

最有意思的设计:让云端模型离线地把整个本地栈自动优化一遍——享受云端智能来诊断和改配置,部署推理时却零云端成本;被云模型调优过的本地配置远好于开箱即用。实测能拿到约 800 倍更低的运行成本加显著延迟降低,且不论用哪个云模型来优化都有收益。他的预测:不久的将来,日常推理调用的很大一部分、甚至多数会走本地设备而非云端。

Josh & Regan:QM——YC 的内部智能体系统

YC 的 Josh 和 Regan 讲 QM,YC 用于工作的开源智能体 harness,给每位员工一个可定制的助手,跑在 Slack 或 WebUI 里。它是一串内部项目演化的结果:2025 年 1 月的「通用智能体」(一个带工具的循环系统提示词);2025 年 6 月把 Claude Code/Codex 塞进 VM 接上 Slack;今年 1 月合伙人开始用 OpenClaw(第一个「拥有自己电脑」的智能体,极可定制);之后他们给 50 多个 Hermes 智能体开了 VM 机群——能用但要大量配置,像打地鼠一样 SSH 进去修。

QM 的两个关键设计决策:一是把系统的大脑从沙箱里拉出来,所有会话集中存到 Postgres 并暴露给智能体,让它能看到全系统汇聚的上下文;二是把沙箱从「智能体的家」降格为「智能体按需取用的资源」——重活自动去找更强的机器,轻活用弱的,把这个选择权交给智能体而非 harness 写死。同理,让智能体自己选择运行时和模型,做敏感研究被拒时可以直接切模型。原则是 harness 极薄,核心就三个工具:远程沙箱执行、对象存储读写、发布内部应用。

他们也坦率讲了坑:智能体经常过早放弃,所以他们做了「grind 工具」——给目标设预算,几小时墙钟时间或一定 token 花费之内不许放弃,结果研究产出和报告质量明显变好(OpenAI 和 Anthropic 破解数学难题用的也是类似技术)。自动化改进循环上,他们喜忧参半:派一群智能体用 LLM 当裁判修 bug,容易得「主角综合征」——每个智能体只摸到大象的一块,看不到整个系统,所以人保留在回路里仍然关键。最后是社交情境:特权信息很容易泄漏进不该出现的上下文,能放进「大脑」的信息实际上受限于权限系统的好坏。

本集带走

  • 先想可表达性,别写死流程:「计划-行动-批评」这类固定循环模型自己会了;真正要 harness 提供的是调用压缩、REPL、程序化创建子智能体这些模型做不到的能力——砍掉一个就是砍掉一种能力。
  • 把上下文当分层缓存管理:权重太贵、上下文会用完,能用程序在 REPL/磁盘上直接操作的数据就别塞进上下文,省钱且能跑更长。
  • harness 略强于当前模型 = 免费飞轮:建得稍超前,跑出的轨迹正好喂下一版模型。
  • 同一权重,harness 决定上限:ArcAGI 从 30% 到 95%+ 全是 harness 的功劳,比较模型时务必固定 harness 和成本预算。
  • 给目标设最低预算:不许智能体过早放弃(几小时或一定 token 内),是最便宜的质量提升手段。
  • 沙箱是资源不是家:让智能体自己挑机器强度、挑模型、挑沙箱提供商,比 harness 写死灵活得多。
  • 自动化修 bug 小心「主角综合征」:LLM 当裁判 + 一群智能体各修各的,容易只见局部;人类在环仍不可少。
全部金句 8 条

我认为 harness 长期以来一直被贬低为二流研究,然而它字面上就给我们带来了 18% 的提升——这就是 harness 一和 harness 二之间的差距。
So I think harnesses have long been belittled as subpar research, yet it literally gives us an 18% bump in the difference between harness one and harness two.
—— 嘉宾 · [01:14]

而仅仅加上一些 harness——这种不配称为研究的东西,只是一些包装和脚手架——我们就能达到 95%,NVIDIA 的 ABO 更是达到了 100%。
And just with some harness, this thing that doesn’t deserve any research, just some wrapper and some scaffolding, we can get to 95% and ABO from NVIDIA got to 100%.
—— 嘉宾 · [03:56]

要么我们在学习系统提示词,要么我们在学习 harness 本身——这非常迷幻。
Either we’re learning the system prompt or we’re learning the harness itself, which is very trippy.
—— 嘉宾 · [14:18]

我跑的第一次就达到了 99.9%。然后我看了日志,发现它在作弊。
The first run that I got, it hit 99.9%. And then I looked at the logs and it was cheating.
—— 嘉宾 · [31:11]

所以它是在跑不是主实验的实验,以此来优化主实验。
So it’s running experiments that are not the main experiment in order to optimize them.
—— 嘉宾 · [35:44]

我们认为在不久的将来,你会看到人们日常推理调用中的很大一部分,甚至可能是大多数,会走向本地设备和本地笔记本电脑或本地工作站,而不是像今天这种一切都被推上云端的标准做法。
We think in the very near future, you’re going to see a huge proportion, maybe even a majority, of people’s daily inference calls going to local devices and on-prem laptops or on-prem workstations, as opposed to the kind of standard of today where everything’s being pushed up to the cloud.
—— 嘉宾 · [45:06]

你就会开始得到这种「主角综合征」——这些智能体做出的修复,实际上只看到了大象的一部分。
You start to get this kind of like main character syndrome where the agents are making fixes that are only seeing their piece of the elephant effectively.
—— 嘉宾 · [53:41]

所以你能放进「大脑」里的信息,实际上受限于你的权限系统有多好。
And so the information that you can put in the brain is effectively like bounded by how good your permission system is.
—— 嘉宾 · [59:22]

接着看

顺着「智能体」挖下去

换个口味