Synthesia CEO:AI 视频不会进好莱坞,而是创造新媒介

Victor Riparbelli · Synthesia CEO · 2026-09-01
听中文精华AI 合成朗读00:00
它将把创建内容的边际成本驱动到零。
— Victor Riparbelli

关联

这一集是 Synthesia 的联合创始人兼 CEO Victor 聊他们怎么用 AI 虚拟形象做视频——最反直觉的一点是,他认为好莱坞会是最后一个采用 AI 视频的行业,AI 生成的内容不会出现在电影院或 Netflix 上,而是诞生在 TikTok 和 Instagram 上,成为一种全新的内容流派

Synthesia 起源于 2016 年 Victor 在伦敦看到斯坦福副教授 Matthias 的一篇论文,这篇论文首次展示神经网络生成逼真视频。Victor 当时在研究 VR 内容创作,发现 VR 的分发和内容制作是双重难题,但如果同样的技术用在视频上,视频的基础设施(YouTube 等)已经存在,分发问题直接消失

2017 年公司成立,融资极其困难——他们被近一百个投资人拒绝,因为当时所有人只想投金融科技,而他们在讲”十年后用想象力就能做好莱坞电影”的科幻故事 。最终 Mark Cuban 通过一封冷邮件,14 小时邮件往来后就投了一百万美元,因为他自己在家实现过那篇论文,完全共享这个愿景

找到真正的用户:不是好莱坞,是企业里发 PDF 的人

最初他们找好莱坞工作室和视频制作机构合作,结果碰壁——这些人的质量要求极高,实验意愿极低,因为他们已经在产出很棒的内容了 。转机来自另一群人:企业里负责培训和教育的人。

这些人拼命想做视频,但唯一能做的就是把长篇文本或幻灯片发出去。他们反复说的是同一件事:我写了这么多内容没人读,读了也记不住,我需要视频和音频,但我没有能力做

关键发现是评估标准完全不同:好莱坞拿 AI 视频和真实电影比,说质量太差;而这些企业用户拿 AI 视频和 10 页 PDF 文档比,觉得好太多了 。这就是 Synthesia 的第一个真实用例——企业里的解释性、教育性视频。

产品形态上,Victor 把它比作 PowerPoint 2.0:普通办公人员登录网页应用,选一个虚拟形象(可以是自己),输入脚本,组合视觉素材,就能生成视频 。不是给视频专家用的,是给写 PPT 的人用的。

从单向视频到双向对话:虚拟形象 + 智能体

Synthesia 正在推出的第二个大产品,是把视频从”单向广播”变成”双向对话” 。具体做法:在视频中插入智能体(背后是 LLM 驱动),比如销售培训场景——员工先看一段教学视频,然后智能体假装成客户,跟你对话 15 分钟,你要回答问题、处理异议、建立同理心

这比被动看视频有效得多,因为人们通过练习和大声说出来学习效果更好 。系统还能通过技术给表现打分,让创建视频的人知道你到底理解了没有

这套实时交互目前在做 beta 测试,几个月内正式发布。第一个场景是培训(他们叫”技能”),之后会扩展到销售模拟、招聘等 。同时也会提供底层 API,让开发者只用实时虚拟形象而不用其他功能

Victor 认为,未来你跟公司互动的方式不太会像现在这样浏览网站(本质上是一本小册子),而是打开一个跟虚拟形象的 Zoom 通话,虚拟形象可以调出内容、共享屏幕,更像跟真人销售做演示 。不过他也指出,面向客户时对质量和延迟的要求极高,必须感觉像跟真人说话;内部用例可以稍微放宽

和视频生成平台的区别:不争通用模型,做垂直应用

面对 Sora 这类通用视频生成平台,Victor 的定位很清晰:不竞争。他认为行业会分成基础模型层应用层

通用世界模型需要海量算力和人才,Google 这种公司做得最好,Synthesia 不去争。他们训练的模型非常垂直——专门针对虚拟形象、人对着镜头说话的场景:需要生成任意长度的片段(不是只有 8 分钟)、需要保持身份一致性(虚拟形象不能每次变样)。他们把通用模型当作合作伙伴和底层供应商来用,比如想让虚拟形象在车里驾驶,就调用通用模型的能力再包一层工作流

声音克隆方面,他们自己训练语音模型,因为企业客户有特殊需求——比如保留口音,市面上现有方案做不好这一点 。同时也用第三方来覆盖更多语言。

AI 内容是新流派,不是好莱坞的替代品

Victor 用合成器打比方:70 年代合成器被发明来模仿钢琴和吉他,但质量差,结果人们拿它创造了全新的电子音乐流派,而钢琴和吉他今天依然在用 。AI 视频也是一样——它不会替代真人拍摄,而是会成为一种看起来根本不同的新流派

好莱坞不会是最先拥抱 AI 的,反而可能是最后。AI 生成的娱乐内容不会出现在院线,而是由没钱的电影系学生在笔记本电脑上做出 17 分钟的短片,发到 Instagram 上 。真人拍摄加 AI 视觉特效(比如五分钟就能生成你在太空中漂浮的画面)会先被采用,但主体仍然是真实视频

关于名人虚拟形象的授权(比如让贝克汉姆教数学),Victor 认为技术上 6 到 12 个月内就能做到 ,商业模式上可以想象成每个视频付名人 1 美元 ,但这不是 Synthesia 的重点——他们是企业 B2B 平台 。他的判断标准很硬:除非技术好到看不出区别,否则对消费者场景来说就不够好

本集带走

  • 找对评估标尺比提升技术更重要:同样一个 AI 视频,跟好莱坞电影比是垃圾,跟 10 页 PDF 比就是飞跃。找到你的用户拿什么在做对比,比盲目追求质量提升更关键。
  • 从单向到双向是视频产品的下一步:在视频中嵌入 LLM 驱动的智能体,让观看者从被动接收变成主动练习和对话,这是企业培训场景里明确的价值升级。
  • 不跟基础模型争,做垂直场景的应用层:通用视频生成是 Google 们的游戏,Synthesia 专注”人对镜头说话”这个垂直场景的特殊需求(任意长度、身份一致性),把通用模型当供应商用。
  • AI 内容是新流派,不是替代品:就像合成器没有替代钢琴而是创造了电子乐,AI 视频会诞生自己的内容形式,先在短视频平台爆发,而不是冲击院线。
  • 冷启动融资的非共识策略:找已经自己实现过相关技术、天然共享愿景的投资人(Mark Cuban 自己在家跑过那篇论文),这样对话从”怎么建公司”开始,而不是从”这东西十年后可能吗”开始。
全部金句 7 条

它将把创建内容的边际成本驱动到零。
It’s going to drive the marginal cost of creating content to zero.
—— Victor Riparbelli · [03:50]

我们找到了他的邮箱,给他发了一封冷邮件,他在四分钟内回复说,我觉得这真的很有趣,带回了一些更多的问题,然后我们进行了一次 14 小时的邮件往来。
We found his email, we sent him a cold email, and he responded back within four minutes saying, I think this is really interesting, came back with some more questions, and then we had a 14-hour email conversation with him.
—— Victor Riparbelli · [08:45]

我对这些事情的感觉一直是,除非技术真正好到你无法分辨区别,否则它就不够好。
My sense with this stuff is always that until the technology is truly so good that you cannot tell the difference, it’s not good enough.
—— Victor Riparbelli · [18:22]

我认为好莱坞将是最后一个采用任何这些东西的行业。
I think Hollywood is going to be the last industry to adopt any of these things.
—— Victor Riparbelli · [27:47]

我认为你将看到的 AI 生成的娱乐内容不在电影院里。
And I think what you will see AI-generated entertainment is not in the cinemas.
—— Victor Riparbelli · [27:51]

AI 内容将只是它自己的流派,看起来将根本不同。
AI content is just going to be its own genre that’s going to look fundamentally different.
—— Victor Riparbelli · [29:22]

我们现在正在尝试的是发明一种专属于我们的新媒体格式。
What we’re trying right now is invent a new media format that is proprietary to us.
—— Victor Riparbelli · [35:45]

接着看

顺着「智能体」挖下去

换个口味