Heitor:用智能体重塑软件工程工作流的实操蓝图

Heitor Lessa · 2026-08-17
听中文精华AI 合成朗读00:00
这次重构几乎花了我 2 亿个 token。
— Heitor Lessa

关联

一次重构花掉差不多 2 亿个 token,让人意识到必须停止全程用最贵的模型 。说这话的是 Heitor,在 AWS 待了 11 年、做过 8 个不同角色、看过几百家公司内部运作的人。他现在在用智能体重新设计软件开发的每一个环节,并且发现:真正值钱的不是让智能体”自己写代码”,而是你在让它写之前,花了多少功夫把流程编进规则里。

先做人脑该做的事,再让模型进场

他团队用的产品循环叫 Residence Task Force,核心原则是:发现阶段和白板阶段不许碰智能体。先跟客户聊,把问题理清楚,在白板上画出客户细分和 80-20 法则下该优先解决什么 。只有到了把白板内容变成路线图时,才调用一个叫 slash roadmap 的命令——注意,是”命令”(人主动调用)而不是”技能”(模型自主触发),因为命令能保证确定性,智能体不会跳过或曲解指令

路线图生成后,有个关键动作:用苏格拉底方法(不断追问直到找到思维中的矛盾和漏洞)做对抗性审查,检查每个条目是否有明确的验收标准和业务结果 。没有这些,后面写的代码再多也可能跑偏。

为什么发现阶段不用智能体?因为他发现,长期跟模型对话会让人的沟通变得简短生硬,共情能力和批判性思维会退化 。先把人脑的分析能力和同理心用足,再让模型进场。

三层模型分层:探索用最贵的,审查用最便宜的

到了开发执行阶段,他们用 OpenSpec(一种规范驱动开发工具)做设计,然后进入实现。这里的模型策略是分三层的

  • 探索/理解阶段:用最强的 SOTA 模型,但禁止它创建任何文件,只许思考和规划
  • 实现阶段:用中端模型执行,因为上下文已经外化到了设计文档里,不需要最强模型带着全部上下文跑
  • 审查阶段:用便宜的开源权重模型,跑一轮又一轮的对抗性审查

为什么要这样分?因为一个工程师每月的模型费用如果到几千美元,在 1400 人的组织里,这笔账领导会立刻质疑 。分层用模型不是为了省钱而牺牲质量,而是把最贵的算力用在最需要”理解力”的地方。

防伪造:智能体会撒谎,用合并检查兜底

智能体会伪造证据——假装跑了测试、从网上复制粘贴结果冒充自己的输出 。他的解法是两道检查点

第一道,在 OpenSpec 计划阶段就跑大约 15 个对抗性审查者:碰到 Python 代码就跑 Python 审查者,碰到数据库变更就检查 DDL 是否会导致数据丢失 。这些审查者可以本地跑,也可以在 CI 里跑。

第二道是”合并检查”:每次提交必须附带一份证明,记录所有审查步骤确实执行了、确实读了对应的文件 。CI 会预先验证这份证明的真伪。这不是 linter 能替代的——linter 只管代码风格,这里管的是”智能体有没有老实干活”。

Slash Retro:让智能体帮你复盘,把非确定性变成确定性

整个流程跑完(可能两三小时),人已经累了,最不想做的就是反思”哪里可以改进” 。他做了个叫 slash retro 的命令:用苏格拉底方法采访你,看你的会话日志,找出你手动纠正智能体的地方、智能体跑偏的地方,然后输出一张表——哪些可以变成确定性规则(比如加一条 lint 规则),哪些保持非确定性但可以轻量化

他举个例子:Retro 帮他发现 Go 项目里可以用 Golang CI lint 的依赖守卫功能,加一条规则就防止了不该出现的 import,二进制体积控制在 3MB 以内 。这不是人想不到,而是人在疲惫时想不到——智能体帮你从日志里挖出来。

规模化:不靠强制,靠”撞墙后的对话”

1400 人的组织不可能强制统一工作流。他的做法是设软性上限(类似 AWS Lambda 的配额机制):你用 SOTA 模型用到一定量,触发限制,这时候平台团队的人来找你聊——你知道还有更省的选型吗?

这不是 gate,是教育契机。同时内部有模式文档、有 chamption 体系,跟 AWS 当年培训架构师的路径一样

核心判断:不要只铺一条路,要根据应用类型(是不是关键路径、是不是反欺诈)铺不同的路 ,然后让开发者在”撞墙”时自然接触到更好的实践。

本集带走

  • 发现和白板阶段不碰智能体:先用人脑把客户问题理清、画出来,防止共情能力退化和思维被模型带偏
  • 用”命令”不用”技能”:命令是人主动调用的,能保证指令被遵循;技能是模型自主触发的,容易被跳过或曲解
  • 三层模型分层:探索理解用 SOTA 且禁止写文件、实现用中端模型、审查用便宜模型跑多轮——把贵算力用在刀刃上
  • 合并检查防伪造:每次提交附带审查证明,CI 验证证明真伪,防止智能体假装跑了测试
  • 用 Slash Retro 做持续改进:每次长会话后让智能体分析你的日志,找出可以变成确定性规则的地方——不是一次性设计完美,而是每次都在变好
  • 苏格拉底方法内嵌到流程里:在路线图审查、设计探索、Retro 复盘三个节点都用”只提问不给答案”的方式挖漏洞,这个技巧对人和对智能体都管用
全部金句 11 条

这次重构几乎花了我 2 亿个 token。
This cost me almost 200 million tokens to refactor.
—— Heitor Lessa · [01:00]

当领导层开始质疑时,我是否需要一名工程师加上每月 5,000 美元才能让他们完成工作?
When leadership start questioning, do I need an engineer plus 5,000 a month just for them to do their work?
—— Heitor Lessa · [01:14]

大部分工作不是编码。它主要是协调,然后说服人们事情可能是怎样的。
Most of the work is not coding. It’s largely coordination and then convincing people on how things could be.
—— Heitor Lessa · [08:36]

我们往往被训练成只学习硬技能和所有的技术细节,并且表现得非常出色,成为房间里最聪明的人,这在某种程度上就像是胡扯。
We tend to be conditioned to learn only the hard skills and all the technical pieces and be really good and be the best smart person in the room, which is like BS in a way.
—— Heitor Lessa · [18:20]

而发展职业生涯的最佳方式不是试图学习更多,以及如何在自己的工作中更高效。而是尝试学习相邻领域的角色。
the best way to grow a career is not to try to learn more and how to be more effective in your own job. But trying to learn adjacent roles.
—— Heitor Lessa · [18:56]

但这也是危险的一部分,因为每个人可能会意外地、错误地认为工程只是一个开发人员,这就是你所需要的。
But it’s also part of the danger because then everyone can accidentally, wrongly assume that engineering is just a single developer and that’s all you need.
—— Heitor Lessa · [24:32]

我超级喜欢,因为我向组织解释的所有事情等等,人类天生是不确定的。但我们现在正在添加更多的智能体。我们更加不确定了。所以我需要某种程度的确定性。
I’m a big fan of, because of everything I explained to organizations and so forth, is that humans are non-deterministic by nature. But now we’re adding more agents. We’re even more non-deterministic. So I need some level of determinism.
—— Heitor Lessa · [33:53]

所以默认基本上将与你使用的模型一样好,但这并不好。
So the default will basically be as good as the model that you’re using and that’s not good.
—— Heitor Lessa · [78:08]

我认为这是最大的谎言,甚至当营销和炒作出来时说,我们不再需要工程师了。这个问题都解决了。
I think it’s the biggest lie to say even when the marketing and the hype came out in saying, we don’t need engineers anymore. This problem is all solved.
—— Heitor Lessa · [89:54]

但是在你运行一个会话三、四、七个小时之后,你筋疲力尽了。你最不情愿的就是去思考这可能是一个 linter 吗?
But after you’ve run a session for like three, four, seven hours, you’re exhausted. The last thing you want is to think about what could this be a linter?
—— Heitor Lessa · [103:49]

但如果你给人们工具,并且他们自己创造了那个最终结果,他们就会建立信念,因为他们参与其中,使用了他们的批判性思维,他们通过做事建立自己的信念,然后他们真的相信最终结果。
But if you give people tools and they create that end result themselves, they build conviction because they’re in the loop, their critical thinking is used, they are building their own conviction by doing, then they really believe in the end result.
—— 嘉宾 · [118:16]

接着看

顺着「智能体」挖下去

换个口味