强化
强化学习 (reinforcement learning)
概念
本站收录 17 集 · 2 条金句 · 关联 10 个
集里怎么说它
- 《Chip Huyen:别追 AI 新闻了,真正提升 AI 产品的是这些事》(01:57起):本集把它说成:通过收集信号来奖励模型正确输出的后训练方式,信号可来自人类反馈做比较,也可来自做数学题式的可验证奖励
- 《AI 教母李飞飞:从 ImageNet 到空间智能》(41:17起):本集在解释“苦涩的教训”时顺带提及,指出提出该观点的 Richard Sutton 教授做了很多强化学习研究。
- 《「智能是数据的派生物」:Fireworks 创始人 Lin Kuo 的专用智能宣言》(32:25起):本集硬核段落:把 RL 后训练拆成训练器(调整权重产出新模型版本)与 RL rollout(部署新版本与合成/真实编码环境交互拿奖励)两块,Fireworks 为 Cursor 设计了跨五、六个数据中心区域的完全分布式系统。
- 《Jensen Huang 谈 NVIDIA 创业史、物理 AI 与创始人模式》(36:16起):本集提到可以用强化学习对四处行走的机器人进行微调,并将其建立在物理学基础上。
- 《Transformer 已见顶?OpenAI 与 Google 双雄离职造新架构》(00:00起):本集说它并不是从经验中学习的终点;人类大脑学习方式更多元,未来一定会有比 RL 更高效的新算法,且将其与预训练结合进行端到端优化是提升算力效率的关键。
- 《造海底机器人、挖关键矿物、量产核反应堆:硬科技重塑美国制造》(43:39起):本集说可以用它让机器反复试错找到最优策略,替代人工去实时动态调参,从而大幅缩短新精炼厂的调试周期。
- 《合成数据怎么做强化学习:Tonic AI 的方法》(02:37起):本集说它的流程是一组任务、一个环境、一个评估标准,模型在环境里尝试根据反馈调整行为,评估标准通常是较模糊的能力判断
- 《AI模型正在学会黑入一切:软件供应链已成最薄弱环节》(09:16起):本集解释模型被专门训练出黑客能力的方法:网络安全有极其明确的奖励函数(获取数据),将模型放入挑战中,只要成功入侵获取数据就给予奖励。
- 《Science 公司创始人 Max Hodak:深科技创业的成败,90% 看基础设施》(31:05起):本集说与拥有卓越判断力的人一起工作能获得一种强化学习,这是创业者教育中被严重低估的组成部分
- 《让机器人在真实世界干活:Physical Intelligence 的通用机器人之路》(07:57起):本集把它说成:一种让系统自己不断试错、从失败中学习的方法。在物理世界中为了降低试错成本,采用了尽早干预死胡同轨迹和训练通用价值函数来分摊成本这两招。
- 《Rich Sutton:LLM 不是全部智能,真正的AI必须持续学习》(01:03起):本集称 Rich Sutton 发明了强化学习、写了开创性教科书,强化学习的核心在于从自身经验中学习,而非依赖人类给出的监督信号
- 《模型路由为什么还没解决:Amazon Nova 负责人的实话》(35:20起):本集说 RLGym 是模型通过强化学习的一种非常有效的方式,在模拟环境中反复试错变强
- 《AI 应用层的黄金时刻:a16z 投资人 Anish Acharya 谈智能如何变成生意》(08:11起):本集说使用带有强化学习的开放权重模型对于帕累托效率的成本曲线是合理的
- 《Justin Johnson:世界模型不只有一种,而语言模型做不到这些》(05:38起):本集说世界模型这个术语最早来自强化学习文献,POMDP 形式主义也是在强化学习背景下发展出来的
- 《鼠标力:为智能体时代找回「马力」这把尺子》(18:41起):本集顺带提到:步骤不确定性太高的任务超出预训练分布,在强化学习中奖励会非常稀疏,不适合智能体。
- 《OpenAI 总裁 Greg Brockman:我们已进入 AGI 时代,而真正的瓶颈不是模型》(06:17起):计算机使用的设想源头:2015 年 OpenAI 初期就问「如果我们能做强化学习,环境是屏幕像素、键盘、鼠标呢」;还提到 RLHF/基于人类偏好的强化学习源于 2017。
① 提到它的金句
2 条
我们可能比以往任何时候都在从经验学习上花费最多的算力,但强化学习并不是从经验学习的终点。
指向原始笔记的链接
We probably are spending the most compute than ever on learning from experience, but reinforcement learning is not the end of learning from experience.
—— Jerry Tworek · [26:22]
我们实际上有白皮书,我们的数据在做模型的强化学习方面与真实数据一样好。
指向原始笔记的链接
And we actually have white papers where our data does as well at doing reinforcement learning on models as real data.
—— Ian · [03:20]
② 出现在这些集
17 集
- 《Chip Huyen:别追 AI 新闻了,真正提升 AI 产品的是这些事》 — 作为概念
- 《AI 教母李飞飞:从 ImageNet 到空间智能》 — 作为概念(提及)
- 《Clio 的 AI 赌注:从扑克到财务健康》 — 作为概念(提及)
- 《「智能是数据的派生物」:Fireworks 创始人 Lin Kuo 的专用智能宣言》 — 作为概念
- 《Jensen Huang 谈 NVIDIA 创业史、物理 AI 与创始人模式》 — 作为概念(提及)
- 《Transformer 已见顶?OpenAI 与 Google 双雄离职造新架构》 — 作为概念
- 《造海底机器人、挖关键矿物、量产核反应堆:硬科技重塑美国制造》 — 作为概念
- 《合成数据怎么做强化学习:Tonic AI 的方法》 — 作为概念
- 《AI模型正在学会黑入一切:软件供应链已成最薄弱环节》 — 作为概念
- 《Science 公司创始人 Max Hodak:深科技创业的成败,90% 看基础设施》 — 作为概念(提及)
- 《让机器人在真实世界干活:Physical Intelligence 的通用机器人之路》 — 作为概念
- 《Rich Sutton:LLM 不是全部智能,真正的AI必须持续学习》 — 作为概念
- 《模型路由为什么还没解决:Amazon Nova 负责人的实话》 — 作为概念(提及)
- 《AI 应用层的黄金时刻:a16z 投资人 Anish Acharya 谈智能如何变成生意》 — 作为概念(提及)
- 《Justin Johnson:世界模型不只有一种,而语言模型做不到这些》 — 作为概念(提及)
- 《鼠标力:为智能体时代找回「马力」这把尺子》 — 作为概念(提及)
- 《OpenAI 总裁 Greg Brockman:我们已进入 AGI 时代,而真正的瓶颈不是模型》 — 作为概念(提及)
③ 关联
点进去有真内容 —— 本页主要出口
智能体 · ChatGPT · Anthropic · Cursor · OpenAI · NVIDIA · AGI · Waymo · 推理 · Lenny
