终结 AI 垃圾内容:Taste Labs 如何度量并对抗 slop
关联
公司 Taste Labs
概念 垃圾话 · 智能体 · 推理时 · LLM 当裁判 · 判断力 · 探针 · Creativity API · brand API
这一集聊的是一个所有人都已经感觉到、但很少有人去认真度量的问题:AI slop——AI 生成内容的那种重复、没有灵魂、千篇一律的质感。主角是 Thais,Taste Labs 的创始人,公司几周前刚从 Stout 出来,使命一句话就能说清:终结 AI 垃圾内容。她给出的最反直觉的判断是:「出色」很难定义,但「垃圾」出奇地好定义——而只要能把垃圾变成一个可量化、可预测的东西,你就有了对抗它的抓手 。
为什么 slop 是个新问题,又不是新问题
slop 这个现象并不新鲜,社交媒体时代就有一堆垃圾内容;但 AI 是它的加速器——任何一个不是设计师、也不是工程师的人,点一个按钮就能做出一整套 PPT、一个网站、一个 web 应用 。Thais 承认这相当神奇,但代价是:生成的成本基本趋于零,而普通人并没有磨练过自己的品味 。
一个设计师一生要接触大量东西、学会识别模式、形成观点、学会克制,才能建立起品味——普通人不可能在每个领域都来一遍 。所以她认为「修复 slop 的办法就是让每个人都有品味」是个糟糕的假设,不现实;正确的问题是:怎么让普通人也能创造出伟大的东西 。
她把 slop 拆成三个反复出现的特征 :
- 重复性——同样的东西出现太多太多次。
- 缺乏契合度(fit)——内容在特定语境、特定时刻、对特定的人感觉不到「正确」。一个人给宠物店要网站,另一个人给金融公司要网站,设计却趋同了——用心做的话不该趋同 。
- 低意图——一堆人快速提示、想一次性生成完事,但更深层的是,我们构建的系统里缺了「意图解读」这个环节:帮用户弄清自己到底想要什么,为创作补充更多色彩和语境 。
把 slop 变成可度量的东西
Thais 坚信:要修复一个东西,必须先度量它、理解它 。于是团队做了一次研究:像时光机那样分析过去 10 年超过 200 万个网站,追踪设计趋势,另外合成生成一组 AI 设计网站做对照 。
两个发现。第一,在 AI 出现之前,互联网就已经在坍缩——配色越来越相似、布局越来越相似,趋势传播得更快导致同质化;但 AI 让重复发生得更猛,而且几乎不看语境——在完全不同的类别里,你能看到非常相似的模式 。
第二,他们做了「探针」(probes):先对所有网站做模式挖掘,把颜色、字体排印、布局、受众这些模糊特征提炼成接近结构化的东西,再训练一批「婴儿分类器」,每个只负责识别一个特征 。当多个探针同时出现的频率被组合起来,就能高置信度地预测一个网站是不是 AI slop,预测能力非常高 。
而且这套探针比大多数 LLM-as-a-judge(让一个大模型直接判断内容是优质人类作品还是 AI 垃圾)的方法表现都好 。这证明 slop 不只是模糊的感觉,而是真实存在、可以量化的东西。
对抗 slop:模型层之外,推理时同样重要
现在业界大量讨论集中在模型层——怎么让模型标准更高。Thais 不否认这必须解决,但她认为**推理时(inference time,也就是模型实际响应用户的那一刻)的问题同等重要甚至更重要**:因为理解上下文和意图的来回往复,恰恰发生在推理的那一刻;只把模型变好而不解决这一层,slop 会继续存在 。
另一个核心判断:生产成本归零之后,变得昂贵、比以往任何时候都重要的是**判断力**——她刻意不用「品味」这个词,而是指辨别什么是对的、把问题拆解到能真正理解并为它构建解决方案的能力 。
对应三个 slop 特征,他们做了几件事:
对抗重复性:Creativity API(暂定名)。 做一个「智能体的灵感机器」,让它产出真正分布之外的东西,而不是落在那个均值里。
关键是,这绝不是把模型温度调高然后祈祷——创造力不是随机性,而是在特定领域理解规则和期望之后,有意地在几件事上偏离、打破规则,同时在其他方面保持对该类别期望的遵循 。比如一份好的 pitch deck 长什么样是有规律的,真正的创意是在懂规律的前提下刻意打破其中几条 。
对抗缺乏契合度:Brand API——他们向公众发布的第一个产品。 伟大的品牌是几十位设计师投入大量技艺和心血的成果,也就是说「对这个公司什么是伟大的」这份工作其实早就预先做完了,只是我们没把它用好 。
Brand API 的做法是:输入一个品牌 URL,把它提取成非常具体的组件,结构化到智能体容易遵循、人也容易对照做判断的程度——既帮智能体产出更贴合品牌的东西,也让你能判断它有没有跑偏、在哪里跑偏 。已有真实案例:让 Claude Design 按某公司品牌做幻灯片,默认产出平庸;走 Brand API 提取流程后,产出与原品牌保真度高得多、细节上感觉也是对的 。更进一步,对于根本没有品牌的普通用户,他们在建一个预制的品牌系统索引:想要「梦幻感」,直接检索一套已被通盘考虑过、内在连贯的梦幻品牌系统,而不是当场生成一个大概率落入 slop 特征的东西 。
对抗低意图:把探针当闸门。 那些婴儿分类器可以直接成为 slop 的把关者——不让你的智能体把 slop 交付出去 。
别急着争论「模型能不能有品味」
有人会问:人类品味的巅峰会不会被模型达到?Thais 的回答是:我们甚至还没赢得争论这个问题的资格——现在的问题是门槛还在地上,先把手头这些分解问题、度量问题的工作做起来,把质量门槛抬高,这才是起点 。
本集带走
- 先度量再修复:把「内容好不好」这种模糊判断拆成颜色、排版、布局等可结构化的特征,训练单一特征的小分类器,组合起来就能高精度预测 slop——比直接让大模型当裁判更有效。
- slop 三个特征可当自查清单:重复性(同质化)、缺乏契合度(不看语境和用户)、低意图(系统不帮用户弄清想要什么)。
- 品牌资产早就存在,只是没用上:把现成的品牌规范提取成智能体可遵循、人可验证的结构化组件,是性价比很高的质量提升手段。
- 创造力 ≠ 调高温度:真创意是先懂领域规则,再有意识地打破其中几条,其余保持遵循。
- 推理时和模型层一样值得投入:理解用户意图、上下文和验证,都发生在推理那一刻,只改模型解决不了 slop。
我觉得有时候很难定义什么是出色,但从大多数人都会同意的意义上说,定义什么是 slop 相当容易。
I think it is hard to define what is great sometimes, but I think it’s pretty easy to define what is slop in the sense that most people would agree.
—— Thais Castello Branco · [03:22]
我认为那种重复感、那种近乎没有灵魂的感觉,是我们所有人在使用 AI 时此刻都能感受到的。
I think the sense of repetition, of kind of soullessness, is something that all of us feel right now when using AI.
—— Thais Castello Branco · [03:28]
顺便说一句,我觉得相当神奇的是,AI 已经发展到了这样的程度:地球上任何一个不是设计师、也不是工程师的人,都可以点一个按钮,突然就做出一整套 PowerPoint,或者做出一个网站,或者做出一个 web 应用。
I think it’s quite magical, by the way, that AI has gotten to a point that any human on the planet that is not even a designer, that is not an engineer, can click a button and suddenly make an entire PowerPoint or make a website or make a web app.
—— Thais Castello Branco · [03:34]
它带来的后果是,生成的成本现在基本上趋于零。
It comes with consequences of suddenly now the cost of generation is basically going to zero.
—— Thais Castello Branco · [03:49]
顺便说一句,这比大多数 LLM-as-a-judge 方法——也就是让一个 LLM 来判断那是优质的人类作品还是 AI 生成的 slop——表现都要好。
This performed better, by the way, than most LLM-as-a-judge methods of asking an LLM to judge if that is great human quality versus AI-generated slop.
—— Thais Castello Branco · [08:29]
我甚至不想在这里用“品味”这个词,是判断力。
I don’t even want to use the word taste here, is judgment.
—— Thais Castello Branco · [09:06]
我不认为我们可以只让模型变得更好而无视、不解决这个问题,否则 slop 会继续存在。
I don’t think that we can ignore and just make models better and not solve this otherwise SOP will keep existing.
—— Thais Castello Branco · [09:57]
为什么不直接检索一个已经过通盘考虑、具有连贯性的梦幻品牌系统,而不是在那个时刻用生成的方式做出来的东西最终可能不太理想,或者又落入那些 slop 的特征里。
Why not retrieve a dreamy brand system that already has been thought out to be cohesive instead of doing like a generative approach the moment of that might end up not so great or might end up again in those pillars of slop.
—— Thais Castello Branco · [13:14]
我想说,这个门槛基本上还在地上。
The bar is kind of really, I would say, on the ground.
—— Thais Castello Branco · [14:25]
顺着「产品方法」挖下去
- 做 evals 不是写单元测试,是从看数据开始的错误分析同概念:LLM-as-a-judge、智能体 (agent)
- 不会写代码的人如何成为全职 vibe coder同概念:智能体 (agent)、判断力 (judgment)
- AI 时代产品经理的生存指南同概念:判断力 (judgment)、智能体 (agent)
换个口味
- Braintrust CEO Ankur Goyal:做 AI 评估的纪律八年不变,但玩法正在剧变同概念:LLM-as-a-judge、智能体 (agent)
- AI 安全排行榜:谁扛住了越狱,谁没有同概念:探针 (probes)、智能体 (agent)
- 用 AI 对抗 AI:一种不用读代码的编程语言 BAML同概念:AI slop(AI 垃圾内容) (slop)、智能体 (agent)
