让AI替你操作电脑和浏览器的三个实战用法
关联
这一集是 How I AI 的主持人,聊她怎么让 AI 直接操控电脑和浏览器来替她干活——不是聊天,是真的控制鼠标键盘、点网页、填表单。她说这个功能是她每天每分钟都在用的、最改变生活的 AI 特性之一 。
要跑起来很简单:装好 ChatGPT 或 Claude 的桌面应用,再在 Chrome 里装上对应的浏览器扩展就行。在 Codex 里有三种调用方式——@browser 会弹出侧边浏览器窗口,@Chrome 用 Chrome 扩展直接操控你正在用的浏览器,@computer 则能控制整台电脑 。但关键不在怎么调,在于你拿它干什么。
用浏览器做 QA:比人更详尽、更无情
第一个场景是给做产品的人用的:让 AI 用浏览器跑一遍你的 Web 应用,做可用性测试。具体做法是,在本地跑着应用的前提下,告诉 Codex「用浏览器测试引导流程的可用性和移动端响应性,过程中截图,把发现的问题做成一个 Google 表格」。
它会启动浏览器技能,那个发光的小游标就会自己跑到浏览器那边,一步步走完整个流程——填表单、点下拉菜单、切换视口大小、测桌面端再测移动端。人做 QA 的时候容易偷懒,只走「快乐路径」(每个必填项都填对、点下一步),但它不会:它会故意不填必填字段看会不会报错,会测错误状态,会查可访问性、溢出、触摸目标大小这些你可能草草略过的东西 。
她举了个真实的例子:她的产品上线已久的引导流程,一直没发现一个 bug——有个页面不选任何选项也能点「继续」,但实际上那个字段是必填的,只是没有前端校验代码,点了也不会往下走。这个 bug 存在的原因就是她自己测试时总是老老实实点了选项。AI 一跑就暴露出来了,因为它会主动测试失败状态 。
跑完之后它找到了 11 个问题,包括 1 个高严重性的导航阻塞项,自动生成了带优先级的 Google 表格,每个问题都附上了截图、视口信息、复现步骤和修复建议。她接着可以直接拿这个表格当跟踪器,派子智能体去逐个修复 。
一个小提示:对这些新模型,「低提示」(少给具体指令)比「过度提示」(列出 25 条要测的东西)效果更好。直接说「QA 这个流程」,让它自己动脑筋定计划,反而更详尽 。
角色扮演式产品调研:让 AI 变成你的用户
第二个场景是她丈夫想出来的:让 AI 扮演特定角色来用你的产品,然后以那个角色的身份给你写调研报告。比如她给 ChatPRD 设了三个角色——一个刚开完会要快速写 PRD 的产品经理、一个要拿 PRD 出技术规范和原型的工程师、一个想了解团队怎么用这个工具的团队负责人。指令就这些,不加更多细节,让它自己走完三遍流程,最后写一份研究风格的评论,包括摩擦点、令人愉悦的地方和改进建议 。
这个做法有意思的地方在于,它能发现一些「显而易见但你自己看不到」的摩擦点。比如它以工程师角色接手 PM 创建的文档时,暴露了一个结构性问题:产品里你可以在一个对话里创建文档,但没办法在另一个对话里 @ 引用或关联那个文档——这在真实协作中是个真痛点,而它作为一个「新鲜眼睛」直接挑出来了 。它还会在遇到加载慢、界面不透明等体验问题时如实记录——哪怕遇到了报错,这些失败状态的反馈对产品改进也一样有价值 。
日常杂活:消息处理、购物、填表、甚至操控手机
到了日常使用层面,她的用法就更多了。
处理 LinkedIn 消息:她让 AI 用浏览器翻未读消息,跟工作相关的直接回复,其他的留下笔记告诉她怎么回,纯感谢类的就友好回复掉。LinkedIn 没有官方 API,这种场景正好适合用浏览器操控来走非官方渠道 。
网购:她让 AI 用 Chrome 扩展去 Free People 的打折区,按她的尺码、哺乳期妈妈的需求、夏威夷七月底的天气来挑 10 件衣服加进购物车但不结账。结果它确实选了长裙、宽松裤子、衬衫这些合适的单品,总共 352 美元 。
不过中间有个插曲——网站检测到了自动化操作弹出了验证,这时候人就得介入当「人工验证层」了 。她说得很到位:有时我们让 AI 为我们干活,有时我们得被 AI 派活 。
填表:采购表、给孩子报夏令营、那种超级老的旧网站表单,扔给浏览器用就行了 。
操控手机:如果你用 Mac,有 iPhone 镜像功能可以把手机屏幕投到桌面上,计算机使用可以直接操作那个镜像。她有一次在外州,需要远程改家里 Wi-Fi 的防火墙设置来 SSH 回自己的电脑——Wi-Fi 管理软件只在手机上,她就让 Codex 通过屏幕镜像操作手机,改完设置、更新路由器、SSH 进去、最后关掉端口,全程自动化 。
最后,当 Codex 里的 MCP 插件不好使的时候,她的兜底方案就是直接说「打开浏览器在网页里做」——浏览器操控本身就是最通用的后备通道 。
本集带走
- 让 AI 做 QA 别只走快乐路径:直接说「测试这个流程的可用性和移动端响应性,截图,问题做成表格」,它会主动测错误状态和边缘情况,比人更详尽。
- 对前沿模型少给指令比多给更好:让它自己定测试计划,效果优于你列出 25 条具体测试项。
- 角色扮演式调研:设定 2-3 个真实用户角色,让 AI 扮演他们走完产品流程,最后输出摩擦点和改进建议——能发现你自己看不到的结构性问题。
- 浏览器操控是最好的兜底通道:当 MCP 或插件不好使、或者目标网站没有 API(比如 LinkedIn),直接让 AI 用浏览器操作网页。
- 人要接受当「验证层」的角色:网站可能检测到自动化操作并弹验证,这时候你得手动过一下——这不是失败,是正常的人机协作分工。
- 通过 iPhone 镜像可以让 AI 操控手机:Mac 上的屏幕镜像 + 计算机使用 = AI 能操作你手机上的 App,适合处理只在手机端有的操作。
我肯定可以在后端测试东西。我肯定可以为前端写测试。但我真正想知道的是,它可用吗?
I can definitely test things on the back end. I can definitely write tests for the front end. But what I really want to know is, is it usable?
—— 嘉宾 · [04:56]
对这些模型进行低提示能比对它们进行过度提示获得更好的效果。
Under prompting these models gets you a much better effect than over prompting them.
—— 嘉宾 · [08:01]
你在这里看到的是,工程师交接暴露了一个结构性断裂,这是聊天纯度中的一个真正问题,即你可以创建一个文档,但你不能像 @ 提及或在另一个线程中引用它。
And what you see here is that the engineer handoff exposed a structural break, which is a real issue in chat purity, which is you can create one document, but you can’t like at mention or reference it in another thread.
—— 嘉宾 · [16:34]
有时我们让 AI 为我们所用,然后有时我们需要 AI 让我们发挥作用。
Sometimes we put AI to use for us, and then sometimes we need AI to put us to use.
—— 嘉宾 · [23:20]
所以有时我只是在 ChatGPT 浏览器使用之上的人工验证层。
And so sometimes I’m just the human verification layer on top of ChatGPT browser use.
—— 嘉宾 · [23:27]
顺着「智能体」挖下去
- AI 当技术联合创始人:一个人怎么做时尚品牌同公司:ChatGPT、Codex · 同概念:智能体 (agent)、浏览器使用 (browser use)、计算机使用 (computer use)
- GPT-6 Astra 上手实测:它会用你的电脑了同公司:Codex、ChatPRD · 同概念:QA、浏览器使用 (browser use)、计算机使用 (computer use)、MCP
- 被裁员后用 ChatGPT 当职业教练:一位撰稿人的两年 AI 进化史同公司:ChatGPT、Codex、Claude · 同概念:智能体 (agent)
换个口味
- 当写代码变便宜,OpenAI Codex负责人说「品味」成了最贵的资源同公司:ChatGPT、Codex · 同概念:智能体 (agent)、计算机使用 (computer use)
- 一封邮件睡出一万七千美金:Every 的 Builder Pack 内幕同公司:Codex、Claude · 同概念:智能体 (agent)、MCP
- Dan Shipper:15人零手写代码,AI原生公司怎么运转同公司:ChatGPT、Codex · 同概念:智能体 (agent)
