LL
LLM 当裁判 (LLM as a judge)
概念
本站收录 5 集 · 2 条金句 · 关联 10 个
集里怎么说它
- 《Braintrust CEO Ankur Goyal:做 AI 评估的纪律八年不变,但玩法正在剧变》(23:43起):本集把 LLM 裁判比作 PM 写 PRD:写得越精确,跑评估的 LLM 就越成功;不该当基准,该当异常检测器,与启发式评分同时上、靠差异判断什么坏了。
- 《做 evals 不是写单元测试,是从看数据开始的错误分析》(26:44起):本集说 LLM 判别器是针对你描述了期望行为但智能体还是反复犯的顽固问题而建的自动评估方式,输出必须是二元判断(true/false),不能打 1-5 分。
- 《GrokBot、Origin 与 Grok 4.6 实测》(20:35起):本集说评测中 30% 权重来自 LLM 评委(使用 GPT-5.5),去掉人味后 LLM 评委讨厌 Grok、偏爱 Claude——说明纯靠 LLM-as-judge 会漏掉人类在意的维度
- 《Clay 的智能体矩阵:如何为数十亿次运行建评估》(05:14起):本集把它说成:用大模型给输出打分的自动化评估器,属非确定离线一格;每个模型裁判都有内在偏好,只围着它爬山可能过拟合。
- 《终结 AI 垃圾内容:Taste Labs 如何度量并对抗 slop》(08:29起):本集说让一个大模型直接判断内容是优质人类作品还是 AI 垃圾的方法,其表现不如他们组合多个探针的做法。
① 提到它的金句
2 条
我认为有很多它表现不太好的情况,但我觉得如果你把 LLM 当裁判的用途从一个基准重新定义为一个异常检测器,那它其实是可以的。
指向原始笔记的链接
Well, I think there’s a lot of cases where it doesn’t work very well, but I think if you reframe the utility of an LLM as a judge from being a benchmark to being an anomaly detector, then I think it’s actually okay.
—— Ankur Goyal · [25:10]
顺便说一句,这比大多数 LLM-as-a-judge 方法——也就是让一个 LLM 来判断那是优质的人类作品还是 AI 生成的 slop——表现都要好。
指向原始笔记的链接
This performed better, by the way, than most LLM-as-a-judge methods of asking an LLM to judge if that is great human quality versus AI-generated slop.
—— Thais Castello Branco · [08:29]
② 出现在这些集
5 集
- 《Braintrust CEO Ankur Goyal:做 AI 评估的纪律八年不变,但玩法正在剧变》 — 作为概念
- 《做 evals 不是写单元测试,是从看数据开始的错误分析》 — 作为概念
- 《GrokBot、Origin 与 Grok 4.6 实测》 — 作为概念(提及)
- 《Clay 的智能体矩阵:如何为数十亿次运行建评估》 — 作为概念
- 《终结 AI 垃圾内容:Taste Labs 如何度量并对抗 slop》 — 作为概念
③ 关联
点进去有真内容 —— 本页主要出口
智能体 · 评估 · 多智能体 · trace · Claude · Codex · Corinne Riley · Lenny · GrokBot · Vishu
