harness
集里怎么说它
- 《从看护智能体到认知投降:工程师该守住什么》(00:17起):本集将 harness 描述为套在模型外面、让智能体得以运作的执行框架;智能体是模型和 harness 在一起;各家的 harness 能力正在趋同收敛
- 《Satya Nadella:别只盯着模型,私有评估和智能体才是企业的护城河》(08:24起):本集将其描述为用于运行、调度和管理多个模型与工具的中间件层。拥有开放的测试框架可接入任意模型,是实现让模型与工具协同爬山的必要基础设施。
- 《Claude Tag:住在 Slack 里的主动型队友,如何让 65% 的 PR 由 AI 开出》(17:36起):本集把它说成:每次出新模型要重新审视并做减法的部分——模型能力变强后,很多之前需要工具层兜底的逻辑可以删掉交给模型自己处理,少即是多
- 《黄仁勋对话 LangChain:用开放堆栈打造企业超级智能体》(01:31起):本集把它说成:套在模型外面的一整套系统(包括框架、上下文、工具、记忆、护栏等),让大语言模型变得真正有用。黄仁勋判断未来公司将建立在 harnesses 而非业务流程之上
- 《OpenAI 开发者日:从结对编程到指挥智能体大军》(10:35起):本集说它是控制智能体行为的核心调度框架,也是开源的,允许所有人 fork、检查、适配和接入开放模型
- 《DevOps 之父 Patrick Debois:AI 时代组织比技术更难成熟》(04:40起):本集把它说成一种约束和引导智能体的框架,是 AI 编码技术堆栈中从规范(spec)到循环(loop)之间的关键层,需要回归测试
- 《Anthropic 平台负责人:Claude 平台的「三层蛋糕」与给 token 分工的「策略」》(00:05起):本集大量讨论:两年前 harness 是引导模型走直线的脚手架,现在模型足够可引导、引导部分可以删掉;harness 该做的是允许模型跑更久,而通用 harness 不存在,值得自己掌控的是验证逻辑
- 《Factory CEO Matan:早两年等于错,退款、路由器与软件工厂》(17:53起):本集核心论点:支持多模型的 harness 反而更强——‘数据之于模型,正如模型之于 harness’,暴露越多模型越不过拟合单一模型的细微特性。
- 《Claude 异步智能体架构的四块基石》(02:29起):本集把它说成:指挥模型干活的控制程序(即「大脑」),在 Managed Agents 架构中变成了只与只追加日志对话的无状态进程,以确保挂了也不会丢失进度。
- 《DoorDash 联合创始人:我们其实是一家机器人公司》(41:08起):本集讨论企业 AI 落地时提出的未解难题:清洗数据、搭好 RL 环境后模型表现很好,真实企业环境却不行——是 harness 还要打磨,还是模型数据分布里根本缺这块能力。
- 《当系统出故障时,让 AI 代替作战室里的 50 个人——Traversal 谈如何造 AI SRE》(10:55起):为智能体提供运行环境和工具的外壳;本集指出需要一个聪明的 harness 来决定何时启动核心智能体,并与数据处理引擎共同设计。
- 《eval 会取代 PRD 吗?AI 产品经理的新工作法门》(03:10起):本集把它说成:包裹在核心前沿模型外围的代码框架,赋予模型调用工具和推理的能力,使其能够执行多步任务。如果没有极强的 harness,目前模型解决不了困难问题。
- 《把智能体推向生产环境:为什么标准基础设施不够用》(00:27起):本集核心概念。指围绕基础模型搭建的全部代码(包括提示词、记忆、工具、基础设施、钩子与中间件等),旨在让模型在给定任务下表现最好;如果智能体 = 模型 + harness,只要不是模型本身,你写的围绕它的代码就是 harness。
- 《Datadog 4000 人AI赋能实战:删掉上下文反而更好》(24:58起):指智能体工具框架(如 Pi),eval 平台需要支持多个 harness 和多个模型。
- 《个人 AGI:用 Markdown 组建你自己的劳动力》(11:19起):本集说线束是将前沿模型和你的上下文连接在一起的东西,可以是 OpenClaw、Claude Code 等套件
- 《产品里的智能体为什么总“瞎”:Harmonic 的上下文可见性法则》(03:29起):本集说它的职责是与模型维持「上下文契约」,确保传入模型的消息列表不触及容量上限或发生上下文腐烂,通过工具按需给模型提供被卸载的数据。
- 《Anthropic 构建生产级智能体的教训:harness 须为模型能力演进而生》(03:48起):本集把它说成:围绕模型构建的外部控制框架。当模型进步而安全带不跟着变时,它会变成拖累性能的死重;必须模块化以便随模型演进快速迭代。
- 《AI 投资泡沫的崩盘剧本:为什么万亿美元建数据中心注定亏钱》(19:36起):本集把它说成:模型上层的编排工具(如 Claude Code、OpenCode),像高功能保姆管住顽童。过去 18 个月的能力提升很大部分来自挽具与后训练,而非动辄十亿美元的预训练。
- 《AI智能体安全:它们听起来像实习生》(06:14起):本集将其描述为套在模型外面让它能调用工具的框架,说为了让 OpenClaw、Scout 这些套索有效,你想给它接上一切——所有邮件、日历、数据库
- 《Clay 的智能体矩阵:如何为数十亿次运行建评估》(03:02起):本集把它说成:Clay 各产品线共用的 eval/智能体测试框架,开发者只需自带 eval 套件和 LLM 裁判即可即插即用;智能体调用工具失败时也用它来改进。
- 《最便宜的模型反而是最便宜的:Factory CTO 谈 AI 定价陷阱》(19:52起):本集称其为新一代应用,所有逻辑在这里发生、状态在这里维护,上下文窗口扩展通过智能体内部的压缩机制而非模型层解决,持续学习也发生在套索层
- 《Rackspace 首席 AI 官 Chetan Gupta:企业该停止纠结模型、开始思考架构》(32:10起):嘉宾认为是最关键的新构建:把机器学习模型与可用成果绑起来的机制;同一个模型配两个不同线束会得到两个不同成果,编码工具好用靠的是编码线束而非模型本身。
- 《Token 都烧在哪了:Cursor 工程师教你把 AI 编程成本打下来》(03:08起):本集把它说成:围绕模型的整套调度框架——模型是引擎,harness 是车;它负责提示管理、拼凑上下文、协调工具调用,并替用户处理模型失忆导致的每轮上下文重喂
- 《用 Cursor 重构遗留代码库:从 PHP 到 React 的完整工作流》(09:50起):本集把它说成:Cursor 在平台与模型之间的层——工具执行、缓存管理、动态上下文管理、上下文组装,是重构大代码库真正发力的地方
- 《别小看 harness:智能体的「脚手架」正在决定成绩》(00:08起):本集主线概念:包裹在 LLM 外面、提供持久状态/工具/计算的那层脚手架;主持人强调同一套权重换个 harness 就能让 ArcAGI 从 30% 到 95%,并将其分为静态 harness 与自我改进 harness 两个时代。
- 《Codex 负责人亲述:OpenAI 内部如何造编程智能体》(21:51起):本集核心框架:「harness 总是比模型领先一点」——它是围绕模型的工具与执行框架,给模型配拐杖(护栏、安全、效率、可控性),随模型变强而缩减。
- 《当智能体学会替你操作电脑:聊天即新浏览器》(34:26起):本集说 harness 是实验室提供的围绕模型的执行框架(含工具调用、系统提示词),其与模型的边界正在模糊——旧模型的长系统提示词「几乎像被 RL 进了新模型」。
- 《用形容词驾驭 AI 设计:Impeccable 的控制哲学》(00:34起):本集指围绕编程模型的工作环境(如 Claude Code、Cursor、Codex),Impeccable 就是装进这些 harness 里发挥作用的设计技能
- 《把画布交给智能体:TLDraw 的空间协作实验》(06:48起):本集说 Fairies 的局限是整个 harness 必须是画布 harness,导致智能体被困在画布里、难以和真实世界配合。
- 《当 AI 决定买什么软件:G2 的「信任层」生意》(37:42起):本集引用 Satya Nadella 的判断收尾:SaaS 只是带业务逻辑的 CRUD 数据库,五年内七成成功的 SaaS 公司将转型为架在语言模型之上的 harness——技能、上下文、治理、连接器四要素,按消费量收费。
- 《Box 创始人 Erin Levy:套壳的逆袭与应用层的万亿机会》(25:03起):本集把它说成:Box 自建的智能体工具框架,内置搜索系统、文件系统访问、文本抽取、分块、即时嵌入等工具,比直接把 API 交给 Claude/OpenAI 在准确率和延迟上都明显更好。
① 提到它的金句
16 条
就像如果我只是让它生成,那将是垃圾。如果我把我自己的上下文给它,像我的策展、我的品味、我的 harness,它就会说,嗯,不要供应商之类的东西,或者它必须有四个声音。
指向原始笔记的链接
Like if I would just have it generate, it will be rubbish. If I had like my own context to it, like my curation, my taste, my harness, it would be say, well, not vendors or kind of like things or like it has to have four voices.
—— Patrick Debois · [12:35]
所以这里出现了一种类比:数据之于模型,正如模型之于 harness。
指向原始笔记的链接
So there’s a sort of analog that emerges where it’s what data is to a model, models are to a harness.
—— Matan Grinberg · [20:06]
我认为另一个有趣的问题是,如果你是一家前沿实验室,真正的护城河在哪里?是在智能中,还是在工具链中?
指向原始笔记的链接
I think the other interesting question is, where is the real moat if you’re a frontier lab? Is it in the intelligence or is it in the harness?
—— Sriram Krishnan · [07:20]
思考这个等式最简单的方法是,如果你不是那个模型,你就是那个框架。
指向原始笔记的链接
the easiest way to think about this equation is that if you’re not the model, you’re the harness.
—— 嘉宾 · [00:56]
Markdown,而不是魔法。胖技能,瘦线束。
指向原始笔记的链接
Markdown, not magic. Fat skills, thin harness.
—— Garry Tan · [16:56]
如果你正在构建一个 UX,并且有一些东西与对话并排很好渲染,但它既不存在于消息列表中,也没有被机具卸载并提供发现它的方式,那么它对智能体来说本质上就是不可见的。
指向原始笔记的链接
if you’re building a UX and you have something that’s nicely rendered side by side with the conversation, but it doesn’t exist either in the message list or offloaded by the harness with a way to discover it, it’ll be essentially invisible to the agent.
—— 嘉宾 · [08:32]
当模型演进而安全带不变时,它会拖累智能体的表现。
指向原始笔记的链接
When the model moves and the harness doesn’t, it degrades the agent.
—— Isabella Kai He · [08:57]
安全带的修复程序不再被需要,并且实际上在 Opus 4.5 的模型性能中起反作用。
指向原始笔记的链接
The harness fixes were no longer needed and were actually detracting from model performance with Opus 4.5.
—— Isabella Kai He · [08:49]
如果他们正在构建正确的产品,他们将能够利用这种判断力,以便今天的判断力成为明天的智能。
指向原始笔记的链接
And if they’re building the right product, they will be able to harness that judgment so that the judgment of today is the intelligence of tomorrow.
—— Julien Bek · [61:45]
我喜欢用的一个类比是:如果模型是引擎,那 harness 本质上就是引擎周围的那辆车。
指向原始笔记的链接
The analogy I like to use is that if the model is the engine, the harness is essentially the car around the engine.
—— Santi Garza · [03:50]
我认为 harness 长期以来一直被贬低为二流研究,然而它字面上就给我们带来了 18% 的提升——这就是 harness 一和 harness 二之间的差距。
指向原始笔记的链接
So I think harnesses have long been belittled as subpar research, yet it literally gives us an 18% bump in the difference between harness one and harness two.
—— 嘉宾 · [01:14]
而仅仅加上一些 harness——这种不配称为研究的东西,只是一些包装和脚手架——我们就能达到 95%,NVIDIA 的 ABO 更是达到了 100%。
指向原始笔记的链接
And just with some harness, this thing that doesn’t deserve any research, just some wrapper and some scaffolding, we can get to 95% and ABO from NVIDIA got to 100%.
—— 嘉宾 · [03:56]
要么我们在学习系统提示词,要么我们在学习 harness 本身——这非常迷幻。
指向原始笔记的链接
Either we’re learning the system prompt or we’re learning the harness itself, which is very trippy.
—— 嘉宾 · [14:18]
从某种意义上说,harness 总是比模型领先一点。
指向原始笔记的链接
So the harness, in a sense, is always a little bit ahead of the model.
—— Tibo Sottiaux · [36:27]
我不得不和模型对抗,不让它表现得像它被训练时所用的那个 harness。
指向原始笔记的链接
I have to fight against the model to not act like the harness that it was trained with.
—— Demetrios Brinkmann · [37:22]
五年后,今天成功的公司里有七成到那时将完成从 SaaS 到 harness 的转变。
指向原始笔记的链接
Five years from now, seven out of 10 companies today that are successful then will have made the switch from SaaS to harness.
—— Tim Sanders · [58:22]
② 出现在这些集
32 集
- 《从看护智能体到认知投降:工程师该守住什么》 — 作为概念
- 《Satya Nadella:别只盯着模型,私有评估和智能体才是企业的护城河》 — 作为概念
- 《Claude Tag:住在 Slack 里的主动型队友,如何让 65% 的 PR 由 AI 开出》 — 作为概念
- 《黄仁勋对话 LangChain:用开放堆栈打造企业超级智能体》 — 作为概念
- 《OpenAI 开发者日:从结对编程到指挥智能体大军》 — 作为概念
- 《DevOps 之父 Patrick Debois:AI 时代组织比技术更难成熟》 — 作为概念
- 《Anthropic 平台负责人:Claude 平台的「三层蛋糕」与给 token 分工的「策略」》 — 作为概念
- 《Factory CEO Matan:早两年等于错,退款、路由器与软件工厂》 — 作为概念
- 《Claude 异步智能体架构的四块基石》 — 作为概念
- 《DoorDash 联合创始人:我们其实是一家机器人公司》 — 作为概念(提及)
- 《当系统出故障时,让 AI 代替作战室里的 50 个人——Traversal 谈如何造 AI SRE》 — 作为概念
- 《eval 会取代 PRD 吗?AI 产品经理的新工作法门》 — 作为概念
- 《把智能体推向生产环境:为什么标准基础设施不够用》 — 作为概念
- 《Datadog 4000 人AI赋能实战:删掉上下文反而更好》 — 作为概念(提及)
- 《个人 AGI:用 Markdown 组建你自己的劳动力》 — 作为概念(提及)
- 《产品里的智能体为什么总“瞎”:Harmonic 的上下文可见性法则》 — 作为概念
- 《Anthropic 构建生产级智能体的教训:harness 须为模型能力演进而生》 — 作为概念
- 《AI 投资泡沫的崩盘剧本:为什么万亿美元建数据中心注定亏钱》 — 作为概念
- 《AI智能体安全:它们听起来像实习生》 — 作为概念(提及)
- 《Clay 的智能体矩阵:如何为数十亿次运行建评估》 — 作为概念
- 《最便宜的模型反而是最便宜的:Factory CTO 谈 AI 定价陷阱》 — 作为概念
- 《Rackspace 首席 AI 官 Chetan Gupta:企业该停止纠结模型、开始思考架构》 — 作为概念
- 《Token 都烧在哪了:Cursor 工程师教你把 AI 编程成本打下来》 — 作为概念
- 《用 Cursor 重构遗留代码库:从 PHP 到 React 的完整工作流》 — 作为概念
- 《别小看 harness:智能体的「脚手架」正在决定成绩》 — 作为概念
- 《Codex 负责人亲述:OpenAI 内部如何造编程智能体》 — 作为概念
- 《AI 的通用遥控器:为什么智能体行业还需要一个 ACP 协议》 — 作为概念
- 《当智能体学会替你操作电脑:聊天即新浏览器》 — 作为概念
- 《用形容词驾驭 AI 设计:Impeccable 的控制哲学》 — 作为概念
- 《把画布交给智能体:TLDraw 的空间协作实验》 — 作为概念(提及)
- 《当 AI 决定买什么软件:G2 的「信任层」生意》 — 作为概念
- 《Box 创始人 Erin Levy:套壳的逆袭与应用层的万亿机会》 — 作为概念
③ 关联
点进去有真内容 —— 本页主要出口
智能体 · Anthropic · Claude Code · OpenAI · 沙箱 · Codex · 评估 · MCP · 护栏 · 推理
