前 Twitter CEO Parag:给智能体重造一个搜索引擎和一个新互联网

2026-08-26
听中文精华AI 合成朗读00:00
我们在 Parallel 的观点是,人类点击数据是一个 bug,使用搜索进行工作的智能体应该依赖智能体反馈,而不是人类反馈。
— Parag

关联

这一集是 Training Data 播客对 Parag 的访谈。Parag 曾任 Twitter 的 CEO,把公司卖给 Elon 之后重新回到创始人轨道,现在做的公司叫 Parallel Web Systems,做的事一句话概括:让智能体(agent)能搜索和使用网络——既重造搜索技术,也重造配套的商业模式。他最核心的一个判断是:智能体使用搜索的量会比人类多一千倍。

搜索的本质:十亿对十亿的匹配问题

先把网络搜索拆开看:搜索引擎先爬取网络、找出所有 URL,把信息组织成索引(提前把页面读好、放在内存里,查询来时就不用临时加载),然后经过多级检索和排序,把数千亿个页面收窄到 5 个、10 个,理想情况下 1 个最相关的结果。Parag 的框架是:这本质上是「十亿到十亿的匹配问题」——数百亿页面对阵随时间累积的数千亿查询。

长期以来只有 Google 和 Bing 做过全网规模的爬取和索引,为什么一家小公司敢碰?他的答案是三点:一是过去新玩家拿不到好的反馈数据(人类评分、点击数据都握在巨头手里),而现在大模型让评分数据可以便宜得多地由专家生产;二是他在 Parallel 的立场很鲜明——人类点击数据是一个 bug,智能体搜索应该依赖智能体反馈,而不是人类反馈;三是找到了一条渐进式建索引的商业路径,不必先烧光钱再服务客户。

具体打法是:先不推搜索产品,先推**搜索智能体**。查询到达后再去实时爬取——做深度研究的用户能容忍一分钟甚至十分钟的等待,这段时间足够爬大量页面。

索引本质上是一种延迟优化,放弃这一维,竞争对手就从「搜索引擎」换成了「外包给人类做数据策展」,后者好打得多。早期客户包括保险承保与理赔工作流、销售数据增强、金融建模的数据采集——都是原来「把数据连夜发给一队人类来整理」的场景。

不是模型实验室,是模型的「补充」

有人问 Parallel 算不算新实验室(neolab)。Parag 的定义是:新实验室的产出是模型,而 Parallel 的产出是对模型的补充——在模型之上做乘法。

模型每进步一次,别人要爬更高的山,Parallel 则多解锁一批可发挥价值的用例。他们不做超大规模预训练,而是把东西压缩成微小的排序模型:每个查询本质上是「从万亿网页里给我一千个 token,而且要是对的那一千个」,要在极有限的算力/延迟预算内做到。此前读取时给三秒算力,新发布的产品压到了 200 毫秒。

为什么不直接让深度研究智能体去调 Google?他的回答是:用 Parallel 搜索,智能体大体上能省掉一半以上的 token,结果更准也更快;省下的 token 意味着能做更多问题、或更便宜更快地做同样的问题。

在他看来,搜索的核心是质量、成本、延迟三者的优化问题,公司的头两年刻意忽略延迟、死磕另外两个,达标后才发布了主打延迟的产品 TurboNow。接口也在变:人类靠关键词搜索(本质是懒,打两个带错字的词求最好结果),而智能体的查询错字更少、定义更好、更长,搜索引擎要猜的东西更少,等于在解决一类不同的问题。

为什么 Google 结果里全是「垃圾页」

他给了一个很精彩的结构性解释。比如查一家上市公司的营收,权威答案在 SEC 备案文件第 73 页的 PDF 里,但那个 PDF 加载要三秒半,你还得自己翻到第 77 页——人类太懒,不会做。

于是网络上出现了整整一类内容:把大家需要的信息放在加载快的页面上、放在首屏上方,99.99% 正确,还从 300 页财报里挑出了 20 条真正该看的信息。这可以叫「前 AI 时代的人类垃圾」,也可以叫「迎合懒惰人类的成功 SEO」。而 Parallel 服务智能体时不受这个权衡绑架:直接从网上最权威的地方取节选,送进智能体的上下文窗口,让它自己决定下一步。

一条查询进来后内部发生什么:先跑模型理解和丰富查询,然后面向一组不同的索引(大索引、新鲜索引、知识图谱/结构化索引)分别改写查询,各自经过检索层和多层排序层,逐级收窄到数万个文档、再到具体段落,最后带回信号最高的一千个 token。不同版本的搜索 API,本质是在这条链路的不同节点投入不同算力,去打不同的延迟和成本档位。

智能体会把搜索量放大多少倍

一个典型搜索智能体即使不做深度研究,也会做 5 到 20 次搜索;ChatGPT 每次普通提问背后是 5 到 10 次搜索,调高档位就是成百上千次。但 Parallel 追求的是更大的倍数:比如手握一万个放贷小企业的组合,原来每月跑一次人工风控流程,现在写成智能体每周跑、生成仪表盘和行动项——搜索量倍数是几十万到一百万级。

Parag 自己用 Notion 的智能体做会议准备文档,一次写好提示词,之后每个会议自动触发几十到几百次网络搜索。他估算自己所有智能体的搜索量是三年前他个人 Google 搜索量的 100 到 1000 倍,但他自认是异常值而非常态——智能体采用仍非常早期。他还引用看到的数据:Cloudflare 监测中 AI 流量的页面阅读量已与人类流量大致相当。

互联网经济学正在崩坏,解法是 Shapley 值

这是他创业的另一半动机。他先为广告正名:广告是高效的变现方案,擅长差异化定价——Google 在大多数查询上亏钱,靠部分查询赚回来,成就了非凡利润率的企业。

但广告的前提是「有限的人类注意力」。如果出现在网上的是人类的智能体,就没人能从这次访问中变现:站长只好请人做 SEO 招揽人类,同时切断智能体。订阅模式也一样——一千个人类里转化 20 个订阅,你懂这个漏斗;而智能体的访问没有统计、没有归因,你分不清它会带来订阅还是只会持续偷内容。

现有的内容变现出路只有跟模型实验室签固定费用合同(含训练授权、责任保护和推理时访问),但这是「头部现象」,而且推理量今年 7 倍、明年再 7 倍地涨,交易规模并不跟着 50 倍地涨——固定价格结构撑不起可持续性。他给出的解法还是差异化定价,但两个维度:内容质量差异 × 用途价值差异(银行家做高价值工作时读你的数据,就该比退休的父亲读付更多钱)。

关键的技术问题是归因:一段回复背后十次搜索、多个来源,怎么分钱?他先给直觉版本——把某个来源从语料库拿掉,重跑智能体,看输出质量掉多少;再看能不能靠多扔一分钱的算力把质量补回来——能补回来,这个来源就大约值一分钱。

这个直觉的形式化就是 Shapley 值:博弈论里分配「合作创造的大于部分之和的蛋糕」的数学方法,ML 里做特征重要性的 SHAP 值就是它。Shapley 值理论上漂亮、实践中难用(要模拟所有子集合作的平行世界),但在网络搜索里恰好可以模拟「没有这个 URL/域名时智能体表现如何」来造数据。

真正的坑是:精确计算一个内容方该得的一美元,可能要花几美元算力——所以只能训模型来估算 Shapley 值。他有信心这条路激励对齐:宏观数学上,把 LLM 推理花费的 2% 到 10% 分给网络数据,就已经比今天所有围墙花园之外的网络数据商业模式加起来还大;按他的计算,距离这套数学能给一大片内容方带来有意义的收入还有 12 到 24 个月。

一个彩蛋:公司注册时的原名就是 Shapley Inc.,只是这名字做 B2B 实在太差,花了六到八个月才改叫 Parallel——一是因为当时在做大量并行的事,二因为他们预见到一张为智能体而生的并行网络:发布内容时开始面向两个受众,人类怎么读、智能体怎么读。这个趋势其实已经在发生:财报电话会议记录,如今通过智能体消费的人几乎肯定多于听音频或读原文的人;Parag 说如果自己是上市公司 CEO,做财报时会说清楚「这些话会被智能体正确转录和解读」,而 Parallel 发布 API 文档时,主要受众已经是智能体,文档也是拿智能体来测的。

终局:网络从「拉」变「推」

他给智能体与网络的关系画了三层:第一层,智能体把网络搜索当工具用(今天的大多数);第二层,更复杂的多智能体系统——子智能体互相唤醒、编排,比如 AI 科学家这类长跑、重算力的系统;第三层最关键:网络从拉取(push/pull 反转)转为推送——不再是「现在去找这个」,而是「如果网上发生了这件事,就叫醒我,我的智能体会去做事」。触发源可以是卫星图像变化、客户评论、另一个智能体完成计算、人类的新洞察。

他常跟团队说的一句话是:如果今天能做、值得做、还有 GPU 可用,就今天做——那明天做什么?做那些响应世界变化的事。到那时,算力将被持续分配到整个网络上,代表所有客户,一直运转。

本集带走

  • 智能体反馈替代人类点击:训练搜索排序不再依赖巨头垄断的点击数据,专家 + 大模型能便宜地生产评分数据——这是小公司敢做全网索引的结构性变化。
  • 先做智能体、后建索引:用「查询后实时爬取」换取时间,绕开先烧钱建全网索引的门槛;索引本质是延迟优化,可以最后补。
  • 搜索 = 质量/成本/延迟三角:先牺牲延迟死磕质量和成本,达标后再攻延迟(TurboNow 把读取时算力从 3 秒压到 200 毫秒)。
  • 给智能体的搜索要省 token:好搜索让智能体少用一半以上 token,等于变相扩了上下文、降了成本。
  • 用 Shapley 值解决内容分账:拿掉某来源、重跑智能体、看质量掉多少、补回要多少算力——把这个直觉形式化,再用模型估算(精确算比付的钱还贵)。
  • 发布要面向两个受众:写财报发言、API 文档时,把「智能体会正确解读」当第一类读者来设计,并用智能体测试文档。
  • 下一个范式信号:网络从拉到推——「发生了 X 就叫醒我」的订阅式智能体工作流,是把算力持续铺到全网的前提。
全部金句 4 条

我们在 Parallel 的观点是,人类点击数据是一个 bug,使用搜索进行工作的智能体应该依赖智能体反馈,而不是人类反馈。
Our view at Parallel is that human click data is a bug and agent doing work with search should rely on agent feedback, not human feedback.
—— Parag · [00:00]

我们创立 Parallels 是基于这样一个赌注:智能体做这件事的次数将比人类历史上多一千倍。
We started Parallels with the bet that agents would do it a thousand times more than humans ever have.
—— Parag · [01:50]

如果你使用 parallel 搜索,你在很大程度上会在你的智能体中使用不到一半的 token。
If you use parallel search, you will, for the most part, use under half the tokens in your agent.
—— Parag · [13:49]

所以,大多数查询,Google 在上面是亏钱的。
So, most queries, Google loses money on.
—— Parag · [35:51]

接着看

顺着「智能体」挖下去

换个口味