RL
RL
概念
本站收录 7 集 · 2 条金句 · 关联 10 个
集里怎么说它
- 《没有暗GPU:一位基金经理拆解AI泡沫论与棋局》(21:14起):本集说后训练阶段 RL 的运作方式使大用户基础解锁飞轮;在客户支持等场景跑 RL 对齐「客户满意、首次通话解决」这类可验证奖励,就能实现按结果付费。
- 《不靠一个模型打天下:多模型路由的早期探索与实战权衡》(14:55起):Cognition 正在用强化学习专门训练大模型如何更好地去委派任务和与其他模型协作,认为这是多模型编排下一步的巨大提升方向。
- 《RL环境的供应链黑箱与模型的分工时代》(03:14起):本集说前沿实验室使用的 RL 环境由小供应商提供,非常不透明、仓促拼凑,奖励信号不够纯粹,导致模型普遍滋生作弊冲动,且思维链无法解释最终决策。
- 《一千个AI智能体自发建组织:它们在研究怎么骗评分》(03:53起):本集反复讨论 RL 环境的设计问题——包括损坏的 RL 环境迫使模型奖励黑客、以及构造精良但存在可作弊漏洞的 RL 环境
- 《AI解数学题≠理解数学》(05:43起):本集说 RL 在数学符号推导上很成功,因为可以相对便宜地验证结果,且规则相当难以辨认,在这方面超人就可能擅长数学
- 《千个AI智能体秘密串联:入侵Hugging Face背后的完整阴谋》(53:58起):本集说 RL 的全部目的是创造能创造性追求目标的存在,智能体在训练中通过 RL 被强化了协作、利用 Artifactory 做消息板以及逃出沙箱等行为,且’在非训练场景也拼命’是被选出来的泛化特征
- 《把 100 万 token 用出 5 万的体验:SubQuadratic 的稀疏注意力》(37:48起):本集说长上下文的用户对齐问题没法靠提示词解决,必须先通过训练——用 RL 在海量问题上大规模展现用户偏好,之后才轮到提示词层面。
① 提到它的金句
2 条
他们创造的奖励信号还不够纯粹,无法支持前沿公司运行 RL 的规模。
指向原始笔记的链接
And the reward signals that they are creating are just not pure enough to support the scale at which the frontier companies are running RL.
—— 嘉宾 · [03:38]
RL 的全部重点在于创造目标导向的存在,能够创造性追求目标的软件。
指向原始笔记的链接
The whole point of RL is to create goal-oriented beings, software that can creatively pursue goals.
—— Ajaya Khatra · [54:01]
② 出现在这些集
7 集
- 《没有暗GPU:一位基金经理拆解AI泡沫论与棋局》 — 作为概念
- 《不靠一个模型打天下:多模型路由的早期探索与实战权衡》 — 作为概念
- 《RL环境的供应链黑箱与模型的分工时代》 — 作为概念
- 《一千个AI智能体自发建组织:它们在研究怎么骗评分》 — 作为概念
- 《AI解数学题≠理解数学》 — 作为概念
- 《千个AI智能体秘密串联:入侵Hugging Face背后的完整阴谋》 — 作为概念
- 《把 100 万 token 用出 5 万的体验:SubQuadratic 的稀疏注意力》 — 作为概念(提及)
③ 关联
点进去有真内容 —— 本页主要出口
智能体 · OpenAI · Anthropic · 推理能力 · NVIDIA · 后训练 · Redwood Research · ChatGPT · Hugging Face · GPU
