从看护智能体到认知投降:工程师该守住什么
关联
很多人把智能体当保姆养——给它权限、盯着它干活、随时救火。这不是智能体的问题,是使用方式的问题。想从”看护”毕业,核心不是换更好的工具,而是给智能体建立身份和治理:当多个子智能体同时跑不同任务时,你得知道谁在干什么,并且限制每个智能体的”爆炸半径”——别让它能删你的生产数据或客户信息 。
现在最大的风险不是技术本身,而是FOMO驱动的盲目实验。一个人试验个人智能体,不小心泄露API密钥、收到巨额账单,这很常见 。但从单人创业公司到成熟企业,能承受的风险完全不同——后者需要安全保障和隐私机制到位 。
关于选什么工具(harness,即套在模型外面的执行框架),有个反直觉的建议:不要迷信”原厂组合最优”。某家公司的模型配上它自家的harness,不一定比拿同一模型配另一个harness效果更好 。
但如果你日常工作已经忙不过来,没有带宽逐个试工具,专注一个也完全没问题——因为各家harness的能力正在趋同,你在一个工具上建立的肌肉记忆和工作模式,切换后大概率还能用 。真正值得你花”创新预算”去关注的,是那些跟所有人做法都不一样的冷门尝试,哪怕看起来很疯狂 。
比工具选择更深的危机是两个词:认知债务和认知投降。认知债务是指代码生成太快,你开始丧失”事情到底怎么完成的”肌肉记忆和技能——如果有天智能体帮不上忙,你还能卷起袖子自己干吗 ?
认知投降更极端:你完全停止批判性思维,智能体生成什么就提交什么、发布什么,出了错再让智能体修 。问题是——你怎么判断智能体修对了没有?生成变容易了,验证才是当前真正的瓶颈 。
解法不是回到纯手动,而是把”什么是好的、什么是对的”编码进系统里:用户旅程、测试用例、视觉回归测试——任何能让智能体的输出有东西可对比的锚点 。否则智能体最多只能打开浏览器点几下,说”我猜注册功能能用”,但这不等于验证了行为没有从上一个版本偏移 。
最后一条实用建议:别以为跑多个智能体就等于你有更多脑子。认知带宽不能并行化。把任务分两堆——孤立的、低风险的扔给后台智能体;需要你真正动脑的,老老实实自己盯 。
本集带走
- 给智能体设爆炸半径:多智能体并行时,必须有身份和治理机制,限制每个智能体能触碰的范围
- 别迷信原厂配对:同一模型配不同harness可能效果更好,值得用你的”创新预算”去试
- 工具趋同,别怕锁定:各harness能力在收敛,一个工具上建立的模式切换后仍适用
- 盯冷门而非热点:真正值得花时间看的是那些跟所有人做法都不一样的尝试
- 把”对”编码进系统:用测试、用户旅程等锚点让智能体输出可对比,解决验证瓶颈
- 认知带宽不并行:任务分两类,低风险孤立任务委派出去,需要动脑的自己盯
如果你试图从看护毕业到更严肃的事情,你有点需要围绕你的智能体拥有身份。
If you were trying to graduate from babysitting to something more serious, you kind of need to have identity around your agents.
—— 嘉宾 · [01:52]
如果智能体可以做任何事情,你想限制爆炸半径,因为我们已经看到很多它们去做你真的没预料到的事情的案例。
if agents can do anything, you want to limit the blast radius because we have seen lots of cases of them going off and doing things that you didn’t really expect.
—— 嘉宾 · [02:10]
把你花在尝试另一个工具的时间看作拥有一个创新代币或一个创新预算,对吧?你没有世界上所有的时间。
Think about the time that you take to invest in trying in another tool as having an innovation token or an innovation budget, right? You don’t have all the time in the world.
—— 嘉宾 · [08:46]
其中一个是认知债务。特别是当我们习惯了代码生成得如此之快这一事实,我们也可能开始丧失关于事情如何正确完成的肌肉记忆。
One of them is cognitive debt. And so especially as we get used to the fact that code is getting generated so quickly right now, we can also start to lose our muscle memory around how things get done right.
—— 嘉宾 · [12:37]
你需要的是将什么是好的、什么是对的编码进你的系统中。
what you need is to codify what good and what right means into your system.
—— 嘉宾 · [15:03]
我想我是能够做这些动作的,但这并不等同于能够验证从一个版本到另一个版本行为没有改变。
I guess I’m able to do these actions, but that’s not the same as being able to verify that the behavior hasn’t changed from one release to another.
—— 嘉宾 · [15:39]
运行多个智能体并不意味着有更多的你可以到处去,因为你有认知带宽这并不并行化。
Running multiple agents does not mean that there is more of you to go around because you have cognitive bandwidth that doesn’t parallelize.
—— 嘉宾 · [16:55]
顺着「智能体」挖下去
- Claude Tag:住在 Slack 里的主动型队友,如何让 65% 的 PR 由 AI 开出同公司:Anthropic、Claude code · 同概念:harness、智能体 (agent)
- Anthropic 平台负责人:Claude 平台的「三层蛋糕」与给 token 分工的「策略」同公司:Anthropic · 同概念:harness、智能体 (agent)
- Factory CEO Matan:早两年等于错,退款、路由器与软件工厂同公司:Claude code · 同概念:harness、智能体 (agent)
换个口味
- Addy Osmani:从造浏览器到对抗认知投降同概念:智能体 (agent)、认知债务 (cognitive debt)、认知投降 (cognitive surrender)
- 代码量暴涨8倍后,工程管理怎么办?同公司:Anthropic、Claude code · 同概念:智能体 (agent)、验证 (verification)
- DevOps 之父 Patrick Debois:AI 时代组织比技术更难成熟同概念:harness、智能体 (agent)
