Tether 做本地 AI:数据中心造太多了

Paolo Ardoino · 2026-08-30
听中文精华AI 合成朗读00:00
我称其为人类历史上最大的普惠金融成功故事。
— Paolo Ardoino

关联

人物 Paolo Ardoino

公司 Tether · QVAC

概念 推理 · 微调 · BitNet · LoRa · 数据中心 · 去中介化 · 智能体 · GPU · 开源

这一集是 Tether 的 Paolo 聊他们做的 QVAC 平台——一个让你在手机和笔记本上跑 AI 模型、做微调、完全不依赖云的开源工具链。Tether 大家可能知道是做 USDT 稳定币的,Paolo 是这家公司的核心人物。他抛出一个相当激进的判断:现在全世界疯狂建的数据中心,大部分将来会是用不上的废铁。

从 USDT 到去中介化

Paolo 的逻辑起点不是 AI,而是金融。Tether 做了 12 年数字美元,攒了 5.73 亿用户,每季度涨 3000 万以上

他的核心观察是:全世界有四五十亿人拿不到基本的银行服务,不是因为他们有问题,而是因为他们太穷,银行觉得没利润 。阿根廷比索五年对美元贬了 94.5%,土耳其里拉贬了 81%,委内瑞拉玻利瓦尔贬了 99.8% ——这些地方的人天然需要一种跟美元挂钩的东西。

Tether 的做法是:不收交易费,靠持有的美元国库券的利息赚钱 。他管这叫”人类历史上最大的普惠金融成功故事” 。更重要的是,他从中提炼出一个信念:金融被过度中介化了,整个技术领域也是

互联网本该是点对点的

Paolo 把这套去中介化逻辑推到了互联网架构层面。他的论点是这样的:互联网生来就是点对点的,你连上网会拿到一个 IP 地址,本质上就是你的”家庭地址”

但后来互联网变了——所有连接都被路由到数据中心去中转 。你住在罗马,给同在罗马的妈妈发一条 WhatsApp 消息,这条消息要先跑到法兰克福或爱尔兰再绕回来

每一张照片、每一段视频都是如此。过去 20 年各国政府在互联网基础设施上花了巨量资金,去路由那些根本不必要中转的数据包

为什么?因为中介方——也就是托管数据的平台——靠持有和中介人们的数据来赚钱,这是错误的激励结构 。他认为 BitTorrent 早就证明了技术上的答案:点对点协议可以扩展到数亿用户和海量数据 ,只是没人把这个思路从文件共享推广到更广泛的应用。

QVAC 到底做了什么

QVAC(Quantumverse Automatic Computer)就是把这个思路搬到 AI 上。要让人在手机上跑 AI,Paolo 说需要解决两个问题:推理(你问模型问题、它回答你)和微调(模型根据你的数据学习,变成”你的”AI)

推理这侧,他们在 Llama CPP(开源 AI 最知名的推理引擎)之上做了大量优化,现在能扩展到几乎所有消费级 GPU

关键的突破来自微软的 BitNet——一种一位量化(1-bit quantization,用极少的位数来表示模型权重,大幅降低计算量)的模型架构 。但原始 BitNet 太依赖英伟达高端 GPU,跑不了消费设备。QVAC 团队改了 BitNet,让它能跑在任何消费级 GPU 上——三星手机上的 Snapdragon GPU、Adreno GPU、Apple GPU 都行

微调这侧,他们建了一个通用的 LoRa(低秩适应,一种只调模型小部分权重就能定制化的小成本微调方法)微调框架 。不只是 BitNet 模型,他们支持数百个模型,开发者可以用同一套框架在任何消费级 GPU 上微调任何模型 。实际效果:你可以在自己笔记本上让模型读你所有邮件,学会用你的语气和习惯回复,数据完全不出你的设备

手机 AI 能覆盖多少需求?

Paolo 的核心主张是:大多数人根本不需要数据中心级别的 AI。95% 到 99% 的人用 AI 就是搜索、翻译、拍购物收据做月末记账、基础教育 ——这些事情今天的手机模型已经能做了。

他举了个具体例子:谷歌的 MedGemma 医疗模型有 270 亿参数,被认为是最先进的;Tether 团队做了一个 40 亿参数的模型,性能超过了它 。40 亿参数意味着可以在高端智能手机上跑;他们还有一个 17 亿参数的版本,能在非洲平均水平的手机上跑

他的预测是:2026 年手机本地模型能覆盖 50% 的普通 AI 用例,三年后到 70%,五年后到 90% 。届时 95% 的人口能在手机上跑 90% 的 AI 用例 。Apple 每年出新 GPU,跑 Llama 模型的速度比上一代快两倍 ——硬件趋势也在往这个方向走。

数据中心会不会过剩?

主持人提了一个很直接的反问:企业和政府的需求呢?那些需要海量算力的场景

Paolo 的回答分两层。第一层:ASIC(专用芯片,为特定计算任务专门设计的硬件,效率远超通用 GPU)会改变游戏规则。

比特币挖矿从 CPU 到 GPU 再到 ASIC,AI 也在走同样的路 。好的 GPU 跑 Llama 3.2 是每秒 150 个 token,AI 专用的 ASIC 能跑到每秒 17,000 个 token 。五年后,一家大银行花 5 万到 10 万美元买十几块 ASIC,就能在本地跑一个极其强大的 AI 集群,能耗降 98%

第二层:主权和安全。意大利的银行不会想把数据全跑在美国的基础设施上,法国也不会,公共行政部门更不会 。所以”主权云”(直接在某国建小型数据中心、就地部署软件)已经是一个真实趋势

他把结论说得很直接:就算企业和政府需要一些集中式算力,那也是小众市场,花几十亿美元,可能还得政府补贴 。绝大多数人、几十亿人,会在手机上用 AI,保持自己数据的隐私

对当前 AI 投资潮的担忧

Paolo 对现在 AI 行业的金融工程有很深的怀疑。他指出许多大 AI 公司在大幅补贴订阅成本——收 200 美元,实际成本可能在 1,000 到 5,000 美元

为什么敢这么干?因为还是私企,可以藏着;而且需要冲用户增长来推估值——花 50 亿补贴换来 500 亿估值增长,这笔账在私企阶段算得过来 。但 2026 年到 2027 年初很多大 AI 公司要上市 ,上市后补贴就藏不住了,成本会转嫁到散户投资者身上

还有一个更根本的质疑:人脑的功耗跟一个土豆电池差不多,而我们计划花 10 吉瓦的电力去重现人脑 。“我认为我们通往智能的方法是相当错误的。” 如果有 10 亿美元,他会选择雇 2,000 名 AI 研究员,而不是买芯片——研究员长期产出更多,芯片随着时间贬值

小模型 vs 大模型

Paolo 不认同”先造大模型、再蒸馏成小模型”的路径依赖。他认为单体模型是不可持续的 ,未来的方向是成百上千甚至数百万个小模型,各自专精不同领域、互相协作

比如一个物理专家模型、一个化学专家模型,要改进化学能力只需微调那一个,不用重训整个巨型模型 。互联网上已经有足够知识,不一定非要靠集中式训练出万亿参数的单体怪物

QVAC 的产品形态和落地

QVAC 不是一个面向终端用户的 App,而是一个 SDK(软件开发工具包)——让开发者把 AI 能力直接嵌进自己现有的应用里 。做地图应用、金融应用、烹饪应用,都可以按需拿对应的”Lego 积木”拼进去 。此外他们会发布一个开源的 QVAC AI 助手 App,跨 Linux、Windows、Mac、iOS、Android 全平台,展示这些模块怎么组合

实际落地方面,开源不到两个月已经有不少公司在上面构建产品 。特别值得注意的是两家机器人公司正在测试把 QVAC 当作机器人的”大脑” ——Paolo 认为机器人不能依赖云端做决策,延迟和安全都不允许

不只是 AI:Tether 的四个板块

Paolo 顺带讲了 Tether 的整体架构,分四个垂直方向:稳定币金融、能源、电信、AI 平台 。能源这块很具体:在非洲最偏远的村庄建太阳能售货亭,顶部装太阳能板,里面放几千块可充电电池

用户每月花两三美元换电池,一块 145 瓦的电池够晚上照明和给手机充电 。已经有 1,000 个亭子、130 万用户 ,计划五六年内扩到 10 万个亭子、覆盖 3000 万家庭

这不是慈善,是商业运作——那些地区的平均月薪是 80 美元 。而这群人正是 Tether 稳定币的用户基础

电信板块则是把 BitTorrent 的点对点思路从文件共享扩展成通用通信协议,能在没有数据中心的情况下扩展到数十亿人和 AI 智能体

Paolo 把所有这些串成一条线:40 亿人拿不到基本金融服务,如果他们同时拿不到基本智能服务,社会差距会进一步撕裂 。金融和 AI 是他花最多精力的两个方向

本集带走

  • 去中介化是 Tether 的统一主线:从稳定币去掉金融中间商,到 QVAC 去掉云数据中心中间商,逻辑一脉相承
  • BitNet + LoRa 是 QVAC 的技术核心:改写微软的一位量化模型让它跑在消费级 GPU 上,加通用微调框架让任何模型都能在本地个性化,数据不出设备
  • 手机 AI 的覆盖速度可能超预期:Tether 用 40 亿参数模型打败了 270 亿参数的 MedGemma,17 亿参数模型能在非洲普通手机上跑
  • ASIC 会进一步削弱数据中心优势:AI 专用芯片跑推理的速度是通用 GPU 的 100 倍以上,能耗降 98%,企业五年内可能用十几块 ASIC 就能在本地跑强集群
  • 当前 AI 订阅大量补贴、不可持续:收 200 美元实际成本可能上千,私企阶段靠补贴冲估值,上市后成本会转嫁给散户
  • 小模型互协作 vs 单体大模型:Paolo 认为万亿参数单体模型不可持续,未来是百万个小模型各司其职、按需微调
  • 机器人是本地 AI 的重要落地场景:延迟和安全要求决定了机器人不能依赖云端决策,必须在本地有计算能力
全部金句 15 条

我称其为人类历史上最大的普惠金融成功故事。
I call it the biggest financial inclusion success story in the history of humanity.
—— Paolo Ardoino · [01:59]

阿根廷比索在过去五年中对美元失去了 94.5% 的价值。
The Argentinian peso lost 94.5% of its value against the US dollar in the last five years.
—— Paolo Ardoino · [03:15]

整个技术也是过度中介化的。
The entire technology is overly intermediated.
—— Paolo Ardoino · [08:07]

想象一下过去 20 年所有政府在互联网基础设施上花了多少钱,来路由那些完全不必要的数据包,而互联网本是被构建为点对点和端到端的。
Imagine how much all the governments spent in internet infrastructure in the last 20 years to route packets data that is completely unnecessary when internet was built to be point-to-point and peer-to-peer.
—— Paolo Ardoino · [10:11]

一个如此智能、无所不知、可以扩展并分发到宇宙四角的 AI,不可能只待在地球上的数据中心里,不可能属于一个人。
An AI that is so intelligent, that knows everything, that can scale and be distributed to the four corners of the universe cannot sit in a data center on Earth, cannot belong to one person.
—— Paolo Ardoino · [16:05]

那些,我认为医学将归功于 AI 取得巨大突破,但它将成为一个小众领域。
Those, I think medicine will have huge breakthroughs thanks to AI, but it will become a niche.
—— Paolo Ardoino · [21:03]

用于 AI 的 ASIC 能够以每秒 17,000 个 token 的速度运行 Llama 3.2。
The ASICs for AI were able to run Llama 3.2 at 17,000 tokens per second.
—— Paolo Ardoino · [24:06]

所以 ASIC 将把效率提高或能耗降低 98%。
So the ASICs will bring efficiency or energy consumption down 98%.
—— Paolo Ardoino · [24:40]

所以如果你不理解你的 AI 是如何工作的,并不是你变得更智能,而是其他人利用你的数据变得更智能。
So if you don’t understand how your AI works, it’s not you becoming more intelligent, it’s someone else becoming more intelligent with your data.
—— Paolo Ardoino · [33:15]

所以 200 美元的订阅成本将从 1 美元到 5,000 美元。这就是现实。
So a 5,000. That’s the reality.
—— Paolo Ardoino · [43:20]

所以我们人类大脑消耗的电力与土豆时钟相同。而且我们计划花费 10 吉瓦来重现人类大脑。
So our human brain consumes the same electricity of a potato clock. And we are planning to spend 10 gigawatts to recreate the human brain.
—— Paolo Ardoino · [45:43]

我认为我们要通往智能的方法是相当错误的。
I think our approach to intelligence is quite wrong.
—— Paolo Ardoino · [46:01]

我相信单体模型是不可 skivable 的,并且不是前进的正确答案。
I believe monolithic models are not skivable and are not the right answer moving forward.
—— Paolo Ardoino · [48:46]

我认为世界将汇聚于拥有数百万个小模型,而不是一个单一的大模型。
And I think that the world will converge in having millions of small models rather than one single large model.
—— Paolo Ardoino · [49:45]

我们不能允许 40 亿无法获得基本金融服务的人也无法获得基本智能服务。
We cannot allow 4 billion people that are the ones that don’t have access to basic financial services also to not have access to basic intelligence services.
—— Paolo Ardoino · [52:44]

接着看

顺着「智能体」挖下去

换个口味