用 AI 审 AI:Vercel 搭建自动批准 PR 机器人实操
关联
既然每个人都能用 AI 写代码,那你的公司大概率正被堆积如山的 PR(拉取请求)淹没——Claire 在这一集开场就甩出了最反直觉的结论:你实际上根本不需要由人类一条条去审查所有这些 PR 。在 2026 年,完全可以通过把 AI 放进审查流程里,安全地跳过人工把关。
这一集来自她的 How I AI 节目,Claire 是 ChatPRD 的创始人,这次她手把手演示了如何构建一个 PR 审查、风险评分和自动批准机器人。你会听到三块内容:首先是 Intercom 是怎么用这套机制把 PR 吞吐量提高两三倍的同时,还能保证合规的;接着是她如何用 Vercel 的 Eve 框架,配合 Codex 的浏览器操作功能,极其简单地搭出这个智能体;最后是具体的落地工作流,以及她对评估和维护这类代码机器人的建议。
既然提到了 Intercom 的成功,那就先来看看他们用这套自动审查系统拿到了什么结果。他们的核心主张是:AI 审批的 PR 不仅能提速,甚至可以比仅有人类参与时更安全、质量更高 。他们公布了几个关键指标:AI 审批 PR 的速度比人类快 5 倍;用 AI 写的代码上线后,回滚率(即代码在生产环境上线后必须修复的比例)要低得多 。
除了安全和质量,很多人一听自动化审批就会抛出合规问题的质疑。对此 Claire 强调,即便你身处 SOC 2(一种企业数据安全合规标准)环境,只要在风险策略和代码审查策略中明确规定,保证整个审查过程是可审计、可查询且可辩护的,你依然能在合规框架内实现自动审批 。Intercom 正是通过这种做法,满足了包括 SOC 2 和 HIPAA(医疗数据隐私保护法案)在内的各种合规要求。
明确了合规性与可行性的前提,接下来看看 Claire 是如何具体打造这套系统的。她为 ChatPRD 构建了这个机器人,当时大量低风险的 PR(比如自动生成的文档更新)堆积在队列里,她和同事根本没时间看 。
她选中了 Vercel 的 Eve 框架。她之所以极力推荐 Eve,是因为它是她在 Slack 和 GitHub 上部署 AI 智能体最简单的方式。
创建一个 Slack 机器人或 GitHub 应用通常需要在后台点过无数个配置屏幕、挑选一堆权限,极其繁琐。但 Eve 提供了连接器向导,把这些刷新令牌之类的痛苦全接管了 。此外,它底层使用开源的 chat SDK(聊天软件开发工具包),专门抹平了跨平台管理多渠道智能体的复杂性。
搭建工具选好了,但配置外部服务依然是个麻烦事,于是 Claire 动用了一个堪称「魔法」的技巧。她让 Codex 接管了 Chrome 浏览器的操作(即 Chrome browser use),让 AI 自己去点击 Slack 和 GitHub 的配置页面 。
人类只负责按下双因素认证(2FA)的按钮和最后确认保存。这个技巧完美解决了「代码能写但不想碰第三方 SaaS 配置」的痛点。
配置全部搞定后,这个被命名为「Merge Mommy」的机器人具体是怎么干活的?它的技术流程非常精简:一旦所有 CI(持续集成)检查通过,GitHub 就会触发事件,Vercel 接管后启动一个沙箱(一种隔离代码的安全运行环境),检出代码库并查看具体的 diff(代码差异)。
它通过几个技能来评估风险和质量,最后输出一个结论。如果是低风险,它会直接提交批准;如果需要人工介入,它就会在 Slack 里 ping 你 。
这个智能体最难写的部分,其实就是一段自然语言写成的指令,连半页纸都不到,Claire 坦言这些指令是她自己写出来并做微调的 。它的核心是一个打分脚本,会考察 6 个维度:变更表面和爆炸半径(影响范围)有多大、是否容易逆转(比如大型数据迁移就很难撤回)、是否涉及数据安全、是否改变了系统运营方式,以及测试和 CI 是否完整 。
这套打分机制会给出一个具体分数:低于 24 分的是低风险,25 到 64 分是中风险,65 分及以上是高风险 。Claire 展示了三个实际案例:一个只改了文档的 PR 拿了 6 分,低风险但因为存在合并冲突被拦截了;另一个纯文档 PR 拿了 7 分顺利自动批准;而一个涉及废弃旧版 API、包含 35 处删除的大红色差异 PR,因为改变了服务器 API 行为,被判定为 45 分的中风险,机器人果断拒绝自动批准,把决定权交还给了人类 。
有了自动评分,最后一步怎么把人类和 AI 的动作顺畅地接起来?这就涉及操作流程的设计。
由于代码仓库的规则通常不允许 bot(机器人)满足必需批准的硬性要求,所以 Merge Mommy 会在 PR 上留一个小灰勾作为信号,然后把消息推送到 Slack 频道里。Claire 和同事只需在 Slack 里看一眼,一键点击批准并合并即可。这个机制完美诠释了 Claire 说的一句话:我们可以让 AI 为我们工作,也可以让 AI 让我们工作,而这个流程让你两方面都做到了 。
最后,对于这种触碰核心代码的内部智能体,持续的评估和改进是必不可少的。正如 Intercom 在流程中所做的,他们把每一次机器人的审查结果都记录在内部的评估平台上,让工程师定期核对:智能体这次判对了吗?
我们的评分机制还准吗 ?就像你会用评估来改进面向客户的 AI 产品一样,面对内部关键系统的机器人,这套闭环检验同样不可或缺。
本集带走
最后收个尾,这一集值得带走的是这几层意思。第一,面对成堆的 AI 生成 PR,人类大可不必逐行死磕,只要策略清晰、可审计,你完全可以安全地跳过低风险代码的人工审查。
第二,写一个代码审查智能体没你想的那么难,用 Vercel 的 Eve 框架,配上一页纸不到的打分指令,甚至让 AI 自己去操纵浏览器搞定复杂的配置,一个下午就能搭出来。第三,真正的杠杆不只是让 AI 全自动干活,而是让它做好评风控、递出信号,最后由人类在 Slack 里点一下按钮完成合并,既榨取了速度,又守住了底线。别忘了,哪怕是内部代码机器人,也要像对待外部产品一样,持续跑评估闭环,才能保证它一直不会作妖。
AI 审批的 PR 以及总体上 AI 编写的代码甚至可以比仅有人类在流程中所做的更安全、质量更高。
AI approved PRs and AI written code in general can be even safer and even higher quality than what you’re doing with just a human in the loop.
—— Claire · [03:47]
AI 审批的 PR 审批得更快,实际上比他们的人类 PR 快 5 倍。
AI approved PRs are approved faster, actually five times faster than their human PRs.
—— Claire · [04:16]
我们可以让 AI 为我们工作,或者我们可以让 AI 让我们去工作。
we can put AI to work for us or we can have AI put us to work.
—— Claire · [20:37]
顺着「AI 编程」挖下去
- 让非工程师也能下指令:Superconductor 的多人智能体协作法同公司:Codex、Slack · 同概念:智能体 (agent)、沙箱 (sandbox)
- Codex 负责人亲述:OpenAI 内部如何造编程智能体同公司:Codex · 同概念:智能体 (agent)、沙箱 (sandbox)
- 把系统提示词删掉八成:Anthropic 团队这样用 Claude 自己造 Claude同公司:GitHub、Slack · 同概念:智能体 (agent)、沙箱 (sandbox)
换个口味
- Claude Code 负责人:写代码已被解决,下一步是什么同公司:Codex · 同概念:智能体 (agent)、沙箱 (sandbox)
- 当 AI 变成黑客武器:给企业智能体修防火墙同公司:Codex · 同概念:智能体 (agent)、沙箱 (sandbox)
- Claude Tag:住在 Slack 里的主动型队友,如何让 65% 的 PR 由 AI 开出同公司:Slack · 同概念:智能体 (agent)、沙箱 (sandbox)
