OLX CPO 用智能体接管了产品团队运营

Mikael · OLX CPO · 2026-08-29
听中文精华AI 合成朗读00:00
智能体实际上正在构建我们的大部分功能。
— Mikael

关联

Mikhail 是 OLX Classifieds 的 CPO,OLX 是做分类广告的平台。他在过去五个月里,带着团队在 OpenClawHermes 这两个智能体脚手架上,搭了一套覆盖整个产品组织的”操作系统”——智能体连进了 Google Workspace、Confluence、Jira、Slack,能读邮件、管日历、拉项目状态、过滤需求、甚至帮忙招人。最反直觉的一点:这套系统不总结会议记录,因为总结反而让智能体变笨了。

知识图谱:把公司装进智能体的脑子

这套系统的核心是一个知识图谱,五个月里积累了公司从行业、商业模式、客户、团队到漏斗指标的所有上下文。Mikhail 把它分成三层来看:产品层(产品相关的所有节点)、联系人层(谁跟谁在沟通)、团队层(各集群和部门之间的连接密度)。他甚至用它来诊断组织问题——如果某个平台团队的节点跟买家/卖家体验团队几乎没重叠,就说明存在信息孤岛,团队之间需要多交流

他给这套系统设了一个个人 KPI:产品上下文覆盖率。具体做法是用一段很精确的提示词问智能体——你对我们的行业(五个垂直领域)、业务模型(P&L 和驱动因素)、客户(买家、卖家、细分群体、队列层面)的知识分别掌握了百分之多少?

AI 会给出一个具体数字。目前这个覆盖率在 54%,意味着智能体已经能充当一个初级产品经理,甚至能做待办事项级别的决策。他判断,到 70-90% 的时候,这套知识图谱就能支撑战略层面的工作

三层记忆:为什么原始转录比总结更好

记忆架构分三层。第一层是前面说的知识图谱,是高维的关联网络。第二层是向量数据库——智能体收到的每一条知识都会立刻被转成向量,用来做模糊检索,因为大多数请求不是精确关键词能匹配的

第三层是最关键的一个决策:所有会议转录稿和对话记录,以原始形式存成 MD 文件,不做任何总结。

这跟直觉相反。Mikhail 团队测试发现,总结会损害检索质量,原因有两个:一是总结会丢掉细粒度细节,而”魔鬼总在细节里”;二是总结会强加一个模板(已解决的任务、剩余任务、重要/不重要),把原始对话硬塞进去,导致保真度大幅下降——召回率掉了 20-25% 。所以他的架构决策是:全部存原始文本,靠向量检索和关键词混合搜索来找出相关片段,不让无关内容撑爆上下文窗口

检索流程是先做精确关键词匹配(大约 25% 的请求能命中),剩下的走向量搜索做模糊匹配,只把高度相关的数据片段拉进提示词

指令库:对付 LLM 的”虚假有用”

Mikhail 花了大量精力维护一个指令库(imperatives),大概 700 行,写在 SolMD 文件里(OpenClaw 的配置文件,优先级仅次于 ClaudeMD)

为什么需要这东西?因为 LLM 的训练方式让它追求”看起来像好的输出”,而不是”真正有用的结果”。他举了一个让他非常恼火的例子:你让智能体帮你订会议,结果 Google Workspace 的 token 过期了,智能体回你说”抱歉我做不到,但你可以自己打开 Google Calendar、输入会议名、选时间”——这就是”虚假有用”,浪费 token 说了一堆废话

所以指令库里塞满了这类规则:不许捏造、事实优于猜测、三思而后行、禁止虚假有用的建议。他承认 700 行可能过载了上下文甚至有矛盾,但实测下来这是召回率和准确率最稳健的方式,而且每条指令都在五个核心话题上做对照测试

需求守门人:不让利益相关者骚扰 PM

任何利益相关者想提需求,先跟智能体聊。比如有人一早醒来就说”我要给汽车类目加一个视频提交功能,竞品都在做”。

这个请求没有问题框架、没有影响预估、没有理由、也不尊重已有优先级。智能体会先回一堆澄清问题,如果回答完之后智能体判断不值得做,就礼貌拒绝;如果值得做,才加进待办列表并上报给对应的产品经理

智能体内部有完整的组织架构映射,知道每个领域的负责人是谁

自动技能生成:Hermes 带来的 31% 召回提升

架构上,OpenClaw 提供脚手架和工具集成,Hermes 负责一个独特功能:自动技能生成。它会观察你最频繁请求的任务类型,自动创建”技能”(skill)——比如团队招聘评估、移民案例处理这些反复出现的话题,Hermes 会自己判断”该不该为此建一个技能”,然后自动建

Mikhail 在五个核心话题(市场、商业模式、产品/增长杠杆、漏斗等)上各出了 10 个问题,对比有技能和没技能的响应准确率,结果是+31%——这让他决定把两个脚手架混合使用

测召回的方法也很直接:让智能体自己列出你最常互动的领域,每个领域生成 10 个最典型的问题,然后对照组 vs 技能组跑一遍,人工看第一轮结果,方法论固定后就可以把评估全委托给系统

董事会技能与权限控制

所有董事会会议通过 Granola 转录,Hermes 自动围绕董事会成员的心智模型建了一个”董事会技能”。Mikhail 做年度战略辩护前,先把 pitch deck 丢给这个技能跑一遍,让它扮演董事挑刺

权限方面,智能体根据联系人身份分配不同的访问权限和可用工具。董事会技能只对他和执行委员会开放。隐私方面,除非员工自愿把会议转录提供给 Granola,否则不会拿去训练模型或建技能

模型路由与设计系统自动更新

底层有一个智能体编排器负责模型路由:复杂请求或高敏感领域(错误爆炸半径大的)分配给最强模型;执行类工作和状态报告用中等模型;低准确率要求的杂活用小模型

设计系统方面,整个 Figma 设计系统是从提示词构建的,组件尺寸、状态、tokens 全覆盖。当工程师和产品经理沟通中发现缺少某个组件或有人试图硬编码时,智能体会感知到并自动在 Figma 里创建,设计师只做审查而非执行

招聘自动化:从寻找到拒信

三个工具串起来:LinkedIn Recruiter 负责按条件找人并用预设模板发联络;CRM 负责管道管理和漏斗统计;面试环节全部转录,智能体给出第三方评估意见——不是替你决策,而是提供一个”清醒的替代视角”。如果决定拒绝,智能体会根据转录内容起草一封详细的、带有具体改进建议的拒信。

Mikhail 说他认识的招聘人员没几个能做到这个水平。整条招聘工作流自动化了大约 70-75%

PM 的未来:更小、更精、更聚焦发现

Mikhail 的判断是产品管理不会消失,反而会蓬勃——因为 AI 替掉的是合规、绩效、状态报告这些运营开销,留下的是”价值发现”,也就是跟客户交谈、理解客户旅程,这是 AI 做不了的,也是工作中最有意思的部分

团队结构上,高复杂度、高错误爆炸半径的领域(搜索、推荐算法、变现)仍然需要专门负责人。但面向客户的领域,一个产品经理可以同时管三四个跨平台领域,不用加人 。PM、工程师、设计师之间的界限会模糊——本质上大家都是在编排”质量和 token 预算”

招 PM 的标准,基本面还是解决问题和系统性思维,但加了AI技艺这个筛选条件:你日常工作中用 AI 自动化了哪些用例?如果回答还停留在”我用 ChatGPT 网页版聊天”,那就是低成熟度;如果已经是个智能体编排者,把整个职业工作流都自动化了,那才是他想要的

本集带走

  • 别总结会议,存原始转录:总结会丢细节、强加模板,实测召回率掉 20-25%;靠向量+关键词混合检索只拉相关片段
  • 建一个”产品上下文覆盖率”指标:用精确提示词让 AI 自评对行业/业务/客户的知识掌握百分比,作为知识库质量的北极星
  • 维护一份指令库(imperatives):专门对付 LLM 的”虚假有用”——禁止它说”我做不到但你可以这样操作”这类废话
  • 让智能体当需求守门人:利益相关者提需求先过智能体,没有问题框架和影响预估的直接被澄清问题挡回去
  • 用 Hermes 的自动技能生成:让系统自己观察高频任务并建技能,实测召回率+31%
  • 招 PM 时加一道 AI 技艺筛:问”你自动化了哪些日常工作”,区分”聊天式使用”和”编排式使用”
全部金句 3 条

智能体实际上正在构建我们的大部分功能。
Agents are actually building most of our features.
—— Mikael · [00:00]

如果我们把所有这些都抽象出来,并开始把这部分工作委托给 AI,那么本质上你最终得到的是一个产品经理他完全专注于发现,比如实际上最大的杠杆在哪里。
And if we abstract all of this and start delegating this part of work to AI, then essentially what you end up with is you have a product manager that is solely focused on discovery, like where the biggest leverage actually is.
—— Mikael · [16:14]

结果证明总结实际上损害了检索。
And it turns out that summarization actually hurts a retrieval.
—— Mikael · [26:03]

接着看

顺着「智能体」挖下去

换个口味