用 AI 审 AI:Vercel 搭建自动批准 PR 机器人实操

Claire · ChatPRD 创始人 · 2026-08-05
听中文精华AI 合成朗读00:00
AI 审批的 PR 以及总体上 AI 编写的代码甚至可以比仅有人类在流程中所做的更安全、质量更高。
— Claire

关联

人物 Claire

公司 Intercom · ChatPRD · Vercel · Codex

概念 Eve · 智能体 · 风险评分 · 沙箱

来源 Lenny’s Podcast

既然每个人都能用 AI 写代码,那你的公司大概率正被堆积如山的 PR(拉取请求)淹没——Claire 在这一集开场就甩出了最反直觉的结论:你实际上根本不需要由人类一条条去审查所有这些 PR 。在 2026 年,完全可以通过把 AI 放进审查流程里,安全地跳过人工把关。

这一集来自她的 How I AI 节目,Claire 是 ChatPRD 的创始人,这次她手把手演示了如何构建一个 PR 审查、风险评分和自动批准机器人。你会听到三块内容:首先是 Intercom 是怎么用这套机制把 PR 吞吐量提高两三倍的同时,还能保证合规的;接着是她如何用 VercelEve 框架,配合 Codex 的浏览器操作功能,极其简单地搭出这个智能体;最后是具体的落地工作流,以及她对评估和维护这类代码机器人的建议。

既然提到了 Intercom 的成功,那就先来看看他们用这套自动审查系统拿到了什么结果。他们的核心主张是:AI 审批的 PR 不仅能提速,甚至可以比仅有人类参与时更安全、质量更高 。他们公布了几个关键指标:AI 审批 PR 的速度比人类快 5 倍;用 AI 写的代码上线后,回滚率(即代码在生产环境上线后必须修复的比例)要低得多

除了安全和质量,很多人一听自动化审批就会抛出合规问题的质疑。对此 Claire 强调,即便你身处 SOC 2(一种企业数据安全合规标准)环境,只要在风险策略和代码审查策略中明确规定,保证整个审查过程是可审计、可查询且可辩护的,你依然能在合规框架内实现自动审批 。Intercom 正是通过这种做法,满足了包括 SOC 2 和 HIPAA(医疗数据隐私保护法案)在内的各种合规要求。

明确了合规性与可行性的前提,接下来看看 Claire 是如何具体打造这套系统的。她为 ChatPRD 构建了这个机器人,当时大量低风险的 PR(比如自动生成的文档更新)堆积在队列里,她和同事根本没时间看

她选中了 Vercel 的 Eve 框架。她之所以极力推荐 Eve,是因为它是她在 Slack 和 GitHub 上部署 AI 智能体最简单的方式。

创建一个 Slack 机器人或 GitHub 应用通常需要在后台点过无数个配置屏幕、挑选一堆权限,极其繁琐。但 Eve 提供了连接器向导,把这些刷新令牌之类的痛苦全接管了 。此外,它底层使用开源的 chat SDK(聊天软件开发工具包),专门抹平了跨平台管理多渠道智能体的复杂性。

搭建工具选好了,但配置外部服务依然是个麻烦事,于是 Claire 动用了一个堪称「魔法」的技巧。她让 Codex 接管了 Chrome 浏览器的操作(即 Chrome browser use),让 AI 自己去点击 Slack 和 GitHub 的配置页面

人类只负责按下双因素认证(2FA)的按钮和最后确认保存。这个技巧完美解决了「代码能写但不想碰第三方 SaaS 配置」的痛点。

配置全部搞定后,这个被命名为「Merge Mommy」的机器人具体是怎么干活的?它的技术流程非常精简:一旦所有 CI(持续集成)检查通过,GitHub 就会触发事件,Vercel 接管后启动一个沙箱(一种隔离代码的安全运行环境),检出代码库并查看具体的 diff(代码差异)

它通过几个技能来评估风险和质量,最后输出一个结论。如果是低风险,它会直接提交批准;如果需要人工介入,它就会在 Slack 里 ping 你

这个智能体最难写的部分,其实就是一段自然语言写成的指令,连半页纸都不到,Claire 坦言这些指令是她自己写出来并做微调的 。它的核心是一个打分脚本,会考察 6 个维度:变更表面和爆炸半径(影响范围)有多大、是否容易逆转(比如大型数据迁移就很难撤回)、是否涉及数据安全、是否改变了系统运营方式,以及测试和 CI 是否完整

这套打分机制会给出一个具体分数:低于 24 分的是低风险,25 到 64 分是中风险,65 分及以上是高风险 。Claire 展示了三个实际案例:一个只改了文档的 PR 拿了 6 分,低风险但因为存在合并冲突被拦截了;另一个纯文档 PR 拿了 7 分顺利自动批准;而一个涉及废弃旧版 API、包含 35 处删除的大红色差异 PR,因为改变了服务器 API 行为,被判定为 45 分的中风险,机器人果断拒绝自动批准,把决定权交还给了人类

有了自动评分,最后一步怎么把人类和 AI 的动作顺畅地接起来?这就涉及操作流程的设计。

由于代码仓库的规则通常不允许 bot(机器人)满足必需批准的硬性要求,所以 Merge Mommy 会在 PR 上留一个小灰勾作为信号,然后把消息推送到 Slack 频道里。Claire 和同事只需在 Slack 里看一眼,一键点击批准并合并即可。这个机制完美诠释了 Claire 说的一句话:我们可以让 AI 为我们工作,也可以让 AI 让我们工作,而这个流程让你两方面都做到了

最后,对于这种触碰核心代码的内部智能体,持续的评估和改进是必不可少的。正如 Intercom 在流程中所做的,他们把每一次机器人的审查结果都记录在内部的评估平台上,让工程师定期核对:智能体这次判对了吗?

我们的评分机制还准吗 ?就像你会用评估来改进面向客户的 AI 产品一样,面对内部关键系统的机器人,这套闭环检验同样不可或缺。

本集带走

最后收个尾,这一集值得带走的是这几层意思。第一,面对成堆的 AI 生成 PR,人类大可不必逐行死磕,只要策略清晰、可审计,你完全可以安全地跳过低风险代码的人工审查。

第二,写一个代码审查智能体没你想的那么难,用 Vercel 的 Eve 框架,配上一页纸不到的打分指令,甚至让 AI 自己去操纵浏览器搞定复杂的配置,一个下午就能搭出来。第三,真正的杠杆不只是让 AI 全自动干活,而是让它做好评风控、递出信号,最后由人类在 Slack 里点一下按钮完成合并,既榨取了速度,又守住了底线。别忘了,哪怕是内部代码机器人,也要像对待外部产品一样,持续跑评估闭环,才能保证它一直不会作妖。

全部金句 3 条

AI 审批的 PR 以及总体上 AI 编写的代码甚至可以比仅有人类在流程中所做的更安全、质量更高。
AI approved PRs and AI written code in general can be even safer and even higher quality than what you’re doing with just a human in the loop.
—— Claire · [03:47]

AI 审批的 PR 审批得更快,实际上比他们的人类 PR 快 5 倍。
AI approved PRs are approved faster, actually five times faster than their human PRs.
—— Claire · [04:16]

我们可以让 AI 为我们工作,或者我们可以让 AI 让我们去工作。
we can put AI to work for us or we can have AI put us to work.
—— Claire · [20:37]

接着看

顺着「AI 编程」挖下去

换个口味