让AI替你操作电脑和浏览器的三个实战用法

2026-09-02
听中文精华AI 合成朗读00:00
我肯定可以在后端测试东西。我肯定可以为前端写测试。但我真正想知道的是,它可用吗?
— 嘉宾

关联

这一集是 How I AI 的主持人,聊她怎么让 AI 直接操控电脑和浏览器来替她干活——不是聊天,是真的控制鼠标键盘、点网页、填表单。她说这个功能是她每天每分钟都在用的、最改变生活的 AI 特性之一

要跑起来很简单:装好 ChatGPT 或 Claude 的桌面应用,再在 Chrome 里装上对应的浏览器扩展就行。在 Codex 里有三种调用方式——@browser 会弹出侧边浏览器窗口,@Chrome 用 Chrome 扩展直接操控你正在用的浏览器,@computer 则能控制整台电脑 。但关键不在怎么调,在于你拿它干什么。

用浏览器做 QA:比人更详尽、更无情

第一个场景是给做产品的人用的:让 AI 用浏览器跑一遍你的 Web 应用,做可用性测试。具体做法是,在本地跑着应用的前提下,告诉 Codex「用浏览器测试引导流程的可用性和移动端响应性,过程中截图,把发现的问题做成一个 Google 表格」

它会启动浏览器技能,那个发光的小游标就会自己跑到浏览器那边,一步步走完整个流程——填表单、点下拉菜单、切换视口大小、测桌面端再测移动端。人做 QA 的时候容易偷懒,只走「快乐路径」(每个必填项都填对、点下一步),但它不会:它会故意不填必填字段看会不会报错,会测错误状态,会查可访问性、溢出、触摸目标大小这些你可能草草略过的东西

她举了个真实的例子:她的产品上线已久的引导流程,一直没发现一个 bug——有个页面不选任何选项也能点「继续」,但实际上那个字段是必填的,只是没有前端校验代码,点了也不会往下走。这个 bug 存在的原因就是她自己测试时总是老老实实点了选项。AI 一跑就暴露出来了,因为它会主动测试失败状态

跑完之后它找到了 11 个问题,包括 1 个高严重性的导航阻塞项,自动生成了带优先级的 Google 表格,每个问题都附上了截图、视口信息、复现步骤和修复建议。她接着可以直接拿这个表格当跟踪器,派子智能体去逐个修复

一个小提示:对这些新模型,「低提示」(少给具体指令)比「过度提示」(列出 25 条要测的东西)效果更好。直接说「QA 这个流程」,让它自己动脑筋定计划,反而更详尽

角色扮演式产品调研:让 AI 变成你的用户

第二个场景是她丈夫想出来的:让 AI 扮演特定角色来用你的产品,然后以那个角色的身份给你写调研报告。比如她给 ChatPRD 设了三个角色——一个刚开完会要快速写 PRD 的产品经理、一个要拿 PRD 出技术规范和原型的工程师、一个想了解团队怎么用这个工具的团队负责人。指令就这些,不加更多细节,让它自己走完三遍流程,最后写一份研究风格的评论,包括摩擦点、令人愉悦的地方和改进建议

这个做法有意思的地方在于,它能发现一些「显而易见但你自己看不到」的摩擦点。比如它以工程师角色接手 PM 创建的文档时,暴露了一个结构性问题:产品里你可以在一个对话里创建文档,但没办法在另一个对话里 @ 引用或关联那个文档——这在真实协作中是个真痛点,而它作为一个「新鲜眼睛」直接挑出来了 。它还会在遇到加载慢、界面不透明等体验问题时如实记录——哪怕遇到了报错,这些失败状态的反馈对产品改进也一样有价值

日常杂活:消息处理、购物、填表、甚至操控手机

到了日常使用层面,她的用法就更多了。

处理 LinkedIn 消息:她让 AI 用浏览器翻未读消息,跟工作相关的直接回复,其他的留下笔记告诉她怎么回,纯感谢类的就友好回复掉。LinkedIn 没有官方 API,这种场景正好适合用浏览器操控来走非官方渠道

网购:她让 AI 用 Chrome 扩展去 Free People 的打折区,按她的尺码、哺乳期妈妈的需求、夏威夷七月底的天气来挑 10 件衣服加进购物车但不结账。结果它确实选了长裙、宽松裤子、衬衫这些合适的单品,总共 352 美元

不过中间有个插曲——网站检测到了自动化操作弹出了验证,这时候人就得介入当「人工验证层」了 。她说得很到位:有时我们让 AI 为我们干活,有时我们得被 AI 派活

填表:采购表、给孩子报夏令营、那种超级老的旧网站表单,扔给浏览器用就行了

操控手机:如果你用 Mac,有 iPhone 镜像功能可以把手机屏幕投到桌面上,计算机使用可以直接操作那个镜像。她有一次在外州,需要远程改家里 Wi-Fi 的防火墙设置来 SSH 回自己的电脑——Wi-Fi 管理软件只在手机上,她就让 Codex 通过屏幕镜像操作手机,改完设置、更新路由器、SSH 进去、最后关掉端口,全程自动化

最后,当 Codex 里的 MCP 插件不好使的时候,她的兜底方案就是直接说「打开浏览器在网页里做」——浏览器操控本身就是最通用的后备通道

本集带走

  • 让 AI 做 QA 别只走快乐路径:直接说「测试这个流程的可用性和移动端响应性,截图,问题做成表格」,它会主动测错误状态和边缘情况,比人更详尽。
  • 对前沿模型少给指令比多给更好:让它自己定测试计划,效果优于你列出 25 条具体测试项。
  • 角色扮演式调研:设定 2-3 个真实用户角色,让 AI 扮演他们走完产品流程,最后输出摩擦点和改进建议——能发现你自己看不到的结构性问题。
  • 浏览器操控是最好的兜底通道:当 MCP 或插件不好使、或者目标网站没有 API(比如 LinkedIn),直接让 AI 用浏览器操作网页。
  • 人要接受当「验证层」的角色:网站可能检测到自动化操作并弹验证,这时候你得手动过一下——这不是失败,是正常的人机协作分工。
  • 通过 iPhone 镜像可以让 AI 操控手机:Mac 上的屏幕镜像 + 计算机使用 = AI 能操作你手机上的 App,适合处理只在手机端有的操作。
全部金句 5 条

我肯定可以在后端测试东西。我肯定可以为前端写测试。但我真正想知道的是,它可用吗?
I can definitely test things on the back end. I can definitely write tests for the front end. But what I really want to know is, is it usable?
—— 嘉宾 · [04:56]

对这些模型进行低提示能比对它们进行过度提示获得更好的效果。
Under prompting these models gets you a much better effect than over prompting them.
—— 嘉宾 · [08:01]

你在这里看到的是,工程师交接暴露了一个结构性断裂,这是聊天纯度中的一个真正问题,即你可以创建一个文档,但你不能像 @ 提及或在另一个线程中引用它。
And what you see here is that the engineer handoff exposed a structural break, which is a real issue in chat purity, which is you can create one document, but you can’t like at mention or reference it in another thread.
—— 嘉宾 · [16:34]

有时我们让 AI 为我们所用,然后有时我们需要 AI 让我们发挥作用。
Sometimes we put AI to use for us, and then sometimes we need AI to put us to use.
—— 嘉宾 · [23:20]

所以有时我只是在 ChatGPT 浏览器使用之上的人工验证层。
And so sometimes I’m just the human verification layer on top of ChatGPT browser use.
—— 嘉宾 · [23:27]

接着看

顺着「智能体」挖下去

换个口味