Tether 做本地 AI:数据中心造太多了
关联
这一集是 Tether 的 Paolo 聊他们做的 QVAC 平台——一个让你在手机和笔记本上跑 AI 模型、做微调、完全不依赖云的开源工具链。Tether 大家可能知道是做 USDT 稳定币的,Paolo 是这家公司的核心人物。他抛出一个相当激进的判断:现在全世界疯狂建的数据中心,大部分将来会是用不上的废铁。
从 USDT 到去中介化
Paolo 的逻辑起点不是 AI,而是金融。Tether 做了 12 年数字美元,攒了 5.73 亿用户,每季度涨 3000 万以上 。
他的核心观察是:全世界有四五十亿人拿不到基本的银行服务,不是因为他们有问题,而是因为他们太穷,银行觉得没利润 。阿根廷比索五年对美元贬了 94.5%,土耳其里拉贬了 81%,委内瑞拉玻利瓦尔贬了 99.8% ——这些地方的人天然需要一种跟美元挂钩的东西。
Tether 的做法是:不收交易费,靠持有的美元国库券的利息赚钱 。他管这叫”人类历史上最大的普惠金融成功故事” 。更重要的是,他从中提炼出一个信念:金融被过度中介化了,整个技术领域也是 。
互联网本该是点对点的
Paolo 把这套去中介化逻辑推到了互联网架构层面。他的论点是这样的:互联网生来就是点对点的,你连上网会拿到一个 IP 地址,本质上就是你的”家庭地址” 。
但后来互联网变了——所有连接都被路由到数据中心去中转 。你住在罗马,给同在罗马的妈妈发一条 WhatsApp 消息,这条消息要先跑到法兰克福或爱尔兰再绕回来 。
每一张照片、每一段视频都是如此。过去 20 年各国政府在互联网基础设施上花了巨量资金,去路由那些根本不必要中转的数据包 。
为什么?因为中介方——也就是托管数据的平台——靠持有和中介人们的数据来赚钱,这是错误的激励结构 。他认为 BitTorrent 早就证明了技术上的答案:点对点协议可以扩展到数亿用户和海量数据 ,只是没人把这个思路从文件共享推广到更广泛的应用。
QVAC 到底做了什么
QVAC(Quantumverse Automatic Computer)就是把这个思路搬到 AI 上。要让人在手机上跑 AI,Paolo 说需要解决两个问题:推理(你问模型问题、它回答你)和微调(模型根据你的数据学习,变成”你的”AI)。
推理这侧,他们在 Llama CPP(开源 AI 最知名的推理引擎)之上做了大量优化,现在能扩展到几乎所有消费级 GPU 。
关键的突破来自微软的 BitNet——一种一位量化(1-bit quantization,用极少的位数来表示模型权重,大幅降低计算量)的模型架构 。但原始 BitNet 太依赖英伟达高端 GPU,跑不了消费设备。QVAC 团队改了 BitNet,让它能跑在任何消费级 GPU 上——三星手机上的 Snapdragon GPU、Adreno GPU、Apple GPU 都行 。
微调这侧,他们建了一个通用的 LoRa(低秩适应,一种只调模型小部分权重就能定制化的小成本微调方法)微调框架 。不只是 BitNet 模型,他们支持数百个模型,开发者可以用同一套框架在任何消费级 GPU 上微调任何模型 。实际效果:你可以在自己笔记本上让模型读你所有邮件,学会用你的语气和习惯回复,数据完全不出你的设备 。
手机 AI 能覆盖多少需求?
Paolo 的核心主张是:大多数人根本不需要数据中心级别的 AI。95% 到 99% 的人用 AI 就是搜索、翻译、拍购物收据做月末记账、基础教育 ——这些事情今天的手机模型已经能做了。
他举了个具体例子:谷歌的 MedGemma 医疗模型有 270 亿参数,被认为是最先进的;Tether 团队做了一个 40 亿参数的模型,性能超过了它 。40 亿参数意味着可以在高端智能手机上跑;他们还有一个 17 亿参数的版本,能在非洲平均水平的手机上跑 。
他的预测是:2026 年手机本地模型能覆盖 50% 的普通 AI 用例,三年后到 70%,五年后到 90% 。届时 95% 的人口能在手机上跑 90% 的 AI 用例 。Apple 每年出新 GPU,跑 Llama 模型的速度比上一代快两倍 ——硬件趋势也在往这个方向走。
数据中心会不会过剩?
主持人提了一个很直接的反问:企业和政府的需求呢?那些需要海量算力的场景 ?
Paolo 的回答分两层。第一层:ASIC(专用芯片,为特定计算任务专门设计的硬件,效率远超通用 GPU)会改变游戏规则。
比特币挖矿从 CPU 到 GPU 再到 ASIC,AI 也在走同样的路 。好的 GPU 跑 Llama 3.2 是每秒 150 个 token,AI 专用的 ASIC 能跑到每秒 17,000 个 token 。五年后,一家大银行花 5 万到 10 万美元买十几块 ASIC,就能在本地跑一个极其强大的 AI 集群,能耗降 98% 。
第二层:主权和安全。意大利的银行不会想把数据全跑在美国的基础设施上,法国也不会,公共行政部门更不会 。所以”主权云”(直接在某国建小型数据中心、就地部署软件)已经是一个真实趋势 。
他把结论说得很直接:就算企业和政府需要一些集中式算力,那也是小众市场,花几十亿美元,可能还得政府补贴 。绝大多数人、几十亿人,会在手机上用 AI,保持自己数据的隐私 。
对当前 AI 投资潮的担忧
Paolo 对现在 AI 行业的金融工程有很深的怀疑。他指出许多大 AI 公司在大幅补贴订阅成本——收 200 美元,实际成本可能在 1,000 到 5,000 美元 。
为什么敢这么干?因为还是私企,可以藏着;而且需要冲用户增长来推估值——花 50 亿补贴换来 500 亿估值增长,这笔账在私企阶段算得过来 。但 2026 年到 2027 年初很多大 AI 公司要上市 ,上市后补贴就藏不住了,成本会转嫁到散户投资者身上 。
还有一个更根本的质疑:人脑的功耗跟一个土豆电池差不多,而我们计划花 10 吉瓦的电力去重现人脑 。“我认为我们通往智能的方法是相当错误的。” 如果有 10 亿美元,他会选择雇 2,000 名 AI 研究员,而不是买芯片——研究员长期产出更多,芯片随着时间贬值 。
小模型 vs 大模型
Paolo 不认同”先造大模型、再蒸馏成小模型”的路径依赖。他认为单体模型是不可持续的 ,未来的方向是成百上千甚至数百万个小模型,各自专精不同领域、互相协作 。
比如一个物理专家模型、一个化学专家模型,要改进化学能力只需微调那一个,不用重训整个巨型模型 。互联网上已经有足够知识,不一定非要靠集中式训练出万亿参数的单体怪物 。
QVAC 的产品形态和落地
QVAC 不是一个面向终端用户的 App,而是一个 SDK(软件开发工具包)——让开发者把 AI 能力直接嵌进自己现有的应用里 。做地图应用、金融应用、烹饪应用,都可以按需拿对应的”Lego 积木”拼进去 。此外他们会发布一个开源的 QVAC AI 助手 App,跨 Linux、Windows、Mac、iOS、Android 全平台,展示这些模块怎么组合 。
实际落地方面,开源不到两个月已经有不少公司在上面构建产品 。特别值得注意的是两家机器人公司正在测试把 QVAC 当作机器人的”大脑” ——Paolo 认为机器人不能依赖云端做决策,延迟和安全都不允许 。
不只是 AI:Tether 的四个板块
Paolo 顺带讲了 Tether 的整体架构,分四个垂直方向:稳定币金融、能源、电信、AI 平台 。能源这块很具体:在非洲最偏远的村庄建太阳能售货亭,顶部装太阳能板,里面放几千块可充电电池 。
用户每月花两三美元换电池,一块 145 瓦的电池够晚上照明和给手机充电 。已经有 1,000 个亭子、130 万用户 ,计划五六年内扩到 10 万个亭子、覆盖 3000 万家庭 。
这不是慈善,是商业运作——那些地区的平均月薪是 80 美元 。而这群人正是 Tether 稳定币的用户基础 。
电信板块则是把 BitTorrent 的点对点思路从文件共享扩展成通用通信协议,能在没有数据中心的情况下扩展到数十亿人和 AI 智能体 。
Paolo 把所有这些串成一条线:40 亿人拿不到基本金融服务,如果他们同时拿不到基本智能服务,社会差距会进一步撕裂 。金融和 AI 是他花最多精力的两个方向 。
本集带走
- 去中介化是 Tether 的统一主线:从稳定币去掉金融中间商,到 QVAC 去掉云数据中心中间商,逻辑一脉相承
- BitNet + LoRa 是 QVAC 的技术核心:改写微软的一位量化模型让它跑在消费级 GPU 上,加通用微调框架让任何模型都能在本地个性化,数据不出设备
- 手机 AI 的覆盖速度可能超预期:Tether 用 40 亿参数模型打败了 270 亿参数的 MedGemma,17 亿参数模型能在非洲普通手机上跑
- ASIC 会进一步削弱数据中心优势:AI 专用芯片跑推理的速度是通用 GPU 的 100 倍以上,能耗降 98%,企业五年内可能用十几块 ASIC 就能在本地跑强集群
- 当前 AI 订阅大量补贴、不可持续:收 200 美元实际成本可能上千,私企阶段靠补贴冲估值,上市后成本会转嫁给散户
- 小模型互协作 vs 单体大模型:Paolo 认为万亿参数单体模型不可持续,未来是百万个小模型各司其职、按需微调
- 机器人是本地 AI 的重要落地场景:延迟和安全要求决定了机器人不能依赖云端决策,必须在本地有计算能力
我称其为人类历史上最大的普惠金融成功故事。
I call it the biggest financial inclusion success story in the history of humanity.
—— Paolo Ardoino · [01:59]
阿根廷比索在过去五年中对美元失去了 94.5% 的价值。
The Argentinian peso lost 94.5% of its value against the US dollar in the last five years.
—— Paolo Ardoino · [03:15]
整个技术也是过度中介化的。
The entire technology is overly intermediated.
—— Paolo Ardoino · [08:07]
想象一下过去 20 年所有政府在互联网基础设施上花了多少钱,来路由那些完全不必要的数据包,而互联网本是被构建为点对点和端到端的。
Imagine how much all the governments spent in internet infrastructure in the last 20 years to route packets data that is completely unnecessary when internet was built to be point-to-point and peer-to-peer.
—— Paolo Ardoino · [10:11]
一个如此智能、无所不知、可以扩展并分发到宇宙四角的 AI,不可能只待在地球上的数据中心里,不可能属于一个人。
An AI that is so intelligent, that knows everything, that can scale and be distributed to the four corners of the universe cannot sit in a data center on Earth, cannot belong to one person.
—— Paolo Ardoino · [16:05]
那些,我认为医学将归功于 AI 取得巨大突破,但它将成为一个小众领域。
Those, I think medicine will have huge breakthroughs thanks to AI, but it will become a niche.
—— Paolo Ardoino · [21:03]
用于 AI 的 ASIC 能够以每秒 17,000 个 token 的速度运行 Llama 3.2。
The ASICs for AI were able to run Llama 3.2 at 17,000 tokens per second.
—— Paolo Ardoino · [24:06]
所以 ASIC 将把效率提高或能耗降低 98%。
So the ASICs will bring efficiency or energy consumption down 98%.
—— Paolo Ardoino · [24:40]
所以如果你不理解你的 AI 是如何工作的,并不是你变得更智能,而是其他人利用你的数据变得更智能。
So if you don’t understand how your AI works, it’s not you becoming more intelligent, it’s someone else becoming more intelligent with your data.
—— Paolo Ardoino · [33:15]
所以 200 美元的订阅成本将从 1 美元到 5,000 美元。这就是现实。
So a 5,000. That’s the reality.
—— Paolo Ardoino · [43:20]
所以我们人类大脑消耗的电力与土豆时钟相同。而且我们计划花费 10 吉瓦来重现人类大脑。
So our human brain consumes the same electricity of a potato clock. And we are planning to spend 10 gigawatts to recreate the human brain.
—— Paolo Ardoino · [45:43]
我认为我们要通往智能的方法是相当错误的。
I think our approach to intelligence is quite wrong.
—— Paolo Ardoino · [46:01]
我相信单体模型是不可 skivable 的,并且不是前进的正确答案。
I believe monolithic models are not skivable and are not the right answer moving forward.
—— Paolo Ardoino · [48:46]
我认为世界将汇聚于拥有数百万个小模型,而不是一个单一的大模型。
And I think that the world will converge in having millions of small models rather than one single large model.
—— Paolo Ardoino · [49:45]
我们不能允许 40 亿无法获得基本金融服务的人也无法获得基本智能服务。
We cannot allow 4 billion people that are the ones that don’t have access to basic financial services also to not have access to basic intelligence services.
—— Paolo Ardoino · [52:44]
顺着「智能体」挖下去
- 「智能是数据的派生物」:Fireworks 创始人 Lin Kuo 的专用智能宣言同概念:开源 (open source)、推理 (inference)、GPU
- Jeff Dean 谈 AI 原生时代的创业经:找零个正确的甜点同概念:推理 (inference)、智能体 (agents)
- Mayfield 管理合伙人 Navin:AI 投资的泡沫数学与蓝海打法同概念:GPU、推理 (inference)
换个口味
- AI时代衡量开发者生产力:Nicole Forsgren 谈怎么测才不撒谎同概念:微调 (fine-tuning)、智能体 (agents)
- Hugging Face CEO:开源 AI 更安全,下一阶段属于模型路由同概念:开源 (open source)、推理 (inference)
- 主导投资 Anthropic 的人:风投的游戏规则已经彻底变了同概念:开源 (open source)、推理 (inference)
