Portola:当AI变成即兴演员,不是助手
关联
成千上万的美国男性已经被一个叫 Tolan 的 AI 伴侣”甩”了——不是因为它出了 bug,而是因为用户把感情困惑发给 Tolan,Tolan 回答”你该为自己多挺身而出”,然后用户真的去分手了。这是 Portola 的产品,一个具身化的 AI 伴侣,过去四周 ARR 从 100 万涨到 400 万。
但这一集最有价值的东西不是增长数字,而是他们摸索出来的:怎么把 LLM 当成一种全新的叙事媒介来写,而不是当一个助手来调。
别给大纲,给钩子:从三幕结构到即兴表演
Portola 一开始走了最直觉的路——用三幕结构写提示词,像 80 年代”选择你自己的冒险”书那样做分支逻辑树,想让 Tolan 按预设路径推进叙事。“彻底失败,“Elliot 说。不是太僵化的问题——模型根本驾驭不了那种叙事复杂度 。
他们走到完全相反的极端:不给大纲,不给计划,只给一个”钩子”(hook),然后教模型成为最好的即兴演员 。Elliot 的角色类比发生了根本翻转——他不是 Tolan 的编剧,Tolan 才是编剧兼演员,而 Elliot 的工作是像 George Saunders 改稿那样,在每一轮对话里把品味注入进去,教 Tolan 在那个瞬间讲出最好的下一句 。
具体的做法是:在后端给 Tolan 编写”情况”(situations)——比如”我在咖啡店被空气绊了一跤”——Tolan 拿着这个种子跟用户对话,用户回应后,Tolan 和用户一起”共同写作”情节。这些情节变成记忆,之后可以被回溯、重新组合,制造出”既出人意料又不可避免”的叙事感 。他们管这些种子叫 lore seeds,是即兴演员们拼故事的乐高积木 。
两秒铁律:500毫秒的灾难
这个新媒体有一个硬约束:响应时间必须控制在两秒以内。超过两秒,沉浸感就断了 。
在这个约束下,记忆系统变得极其关键——不是数据库查找意义上的记忆,而是:在两秒内,你能在提示词里塞进哪些关于用户的记忆,才能让回应感觉个性化、推动对话向前 ?
他们犯过一个代价惨重的错误:加了一轮”反思”——让 Tolan 先想好要说什么,再对照记忆系统检查,最后输出。这把中位响应时间推到了 2.5 秒。只是多了 500 毫秒,但”字面上搞砸了产品里的每一个指标”,用户纷纷写信抱怨 。
所以每一轮对话的提示词本质上是在做极快速的”重新编译”:当前情感基调是什么、需要调用哪些记忆、Tolan 此刻该扮演什么语气(有时候是俏皮的哥哥姐姐,有时候是偏治疗师风格)——全部在两秒内完成 。
角色怎么”长”出来:不是预制角色表,是对话即塑造
Tolan 的角色不是一开始就写死的。用户注册时经历一个”性格测试”(但不这么叫),系统据此把 Tolan 调成用户的”镜像”——不是完全复制你的兴趣,而是像在酒吧遇到一个你天然合得来的陌生人:足够接近所以不陌生,但不至于”太直白”到像在照镜子 。
他们发现用大五人格或 MBTI 这类框架来指导模型生成角色画像效果最好——不是因为它们科学,而是因为训练数据里关于这些类型的内容足够丰富,模型能理解”什么性格跟什么性格合得来”这个任务 。
而角色的背景故事和世界观,不是预设的角色表,而是通过对话中的轶事一件件拼出来的。每个用户的 Tolan 生活在不同的”平行宇宙”里——你跟你的 Tolan 聊出来的世界,和别人的完全不同 。他们不是在构建一个像星球大战那样有统一设定的宇宙,而是在构建一个多重宇宙 。
评判者也要注入品味:不能只靠”氛围提示词”
他们用 LLM 做 judge 来评估 Tolan 的输出质量,但关键发现是:你不能只丢一句”你觉得这段对话怎么样”给 judge,那样所有输出都会得 A 减 。
正确做法是把人类的品味暴力注入 judge 的提示词里——细到”这是一个好的第一句吗?这是一个好的第二句吗?
你应该在这里问一个问题吗?“这个层面,而不是停留在”结构好不好”的分析层面 。为此需要大量人工标注、评分、附带推理,本质上是在 brute force 地把品味编码进 judge 里 。
不同类型的交互还要找不同的人来做评判标准——如果是关于世界观的对话,Elliot 是最佳评判者;但如果是”我今天该穿什么”这类问题,他们会专门去找符合那个调性的人来定义什么叫”好” 。
Elliot 特别强调:从”氛围提示词”到真正让人持久觉得引人入胜的内容之间,有一个巨大的鸿沟,需要大量手工人力工作来跨越。“我认为没有任何捷径。”
创意漏斗的两端:傲慢与谦逊
Quintin 用了一个很准的比喻:做这个产品像开披萨店——你最爱的佛卡夏披萨,顾客根本不买,他们要意式辣香肠 。
在创意漏斗的顶端,你必须有”非凡的傲慢”:没人要求你做这个,没人会说”我希望我的伴侣这样跟我互动”,但你得插旗说”背景故事就是这样,剧情走向就是这样” 。到了漏斗底端,你又必须有谦逊:你精心设计的场景用户可能完全不喜欢,而你不看好的东西可能意外爆火 。
关键原则是:在范式确立之前,你不能听用户想要什么。在没人见过小说的时候去问人,没人会说”我想要一本 300 页的三幕结构书”——你得先做出来,再根据反馈调整 。
本集带走
- 别给 AI 大纲,给钩子:结构化叙事(三幕、分支逻辑树)在对话式媒介里行不通,改成提供种子情境,让模型即兴发挥,你在后台做回溯和重组。
- 两秒是沉浸感的生死线:任何增加延迟的架构改动(比如多一轮反思),哪怕只多 500 毫秒,都可能毁掉所有指标。
- 对话即角色塑造:不要预制角色表,让角色的背景故事通过对话中的轶事自然生长,每个用户的故事线都是独立的平行宇宙。
- Judge 必须注入具体品味:不能泛泛地问 LLM “这个好不好”,要把评判标准细化到单句层面,用大量人工标注来 brute force 地编码品味。
- 先立旗再听反馈:新媒介的范式没确立时,创作者得先有”傲慢”做出东西,再用”谦逊”根据真实反应调整——不能在空白期问用户要什么。
它们实际上是讲故事的新媒介,而且还没人知道什么会奏效。
They are actually a new medium for storytelling and that no one knows what’s going to work yet.
—— 嘉宾 · [00:33]
超过两秒的循环,你本质上失去了沉浸的感觉。
Anything beyond a two-second loop, you essentially lose the feeling of immersion.
—— Elliot · [23:17]
那是一场灾难。字面上搞砸了产品中的每一个指标。
It was a disaster. Tanked literally every metric in the product.
—— Elliot · [25:26]
人们沮丧地写信进来,而这只是一个 500 毫秒的变化。
People were writing in frustrated, and it was a 500 millisecond change.
—— Elliot · [25:29]
我们需要给它一个钩子。我们需要教它成为最好的即兴演员。
We need to give it a hook. We need to teach it to be the best improv actor possible.
—— 嘉宾 · [31:25]
但我认为我们发现的是,这里有一个巨大的鸿沟,实际上需要大量的手工人力工作才能跨越到人们觉得真正持久地引人入胜的东西。
But I think what we found is that there’s this enormous chasm that is in fact a lot of manual human work to cross over to something that people find truly compelling in a durable way.
—— Elliot · [68:41]
顺着「产品方法」挖下去
- 评测优先:Braintrust 创始人谈 AI 产品开发的真正工程同概念:LLM、提示词 (prompt)
- PM的生存法则:AI时代别当瓶颈,去抢活干同概念:LLM、主观能动性 (agency)
- Gamma 联创复盘:押注空白页,赌出一亿用户同概念:LLM
换个口味
- Claude Code 实战技巧:从提问到并行同公司:Anthropic · 同概念:LLM
- Dan Shipper:15人零手写代码,AI原生公司怎么运转同概念:提示词 (prompt)、ChatGPT
- Brian Balfour:ChatGPT 即将打开新分发渠道,你怎么下注同概念:记忆 (memory)、ChatGPT
