带人
带人类反馈的强化学习 (reinforcement learning with human feedback)
概念
本站收录 1 集 · 0 条金句 · 关联 10 个
集里怎么说它
- 《Handshake:靠学生网络四个月做到五千万ARR》(07:58起):本集说 RLHF 是让人来判断回答 A 和回答 B 哪个更好的偏好排序数据,属于后训练的范畴
② 出现在这些集
1 集
- 《Handshake:靠学生网络四个月做到五千万ARR》 — 作为概念
③ 关联
点进去有真内容 —— 本页主要出口
Garrett Lord · Lenny · Handshake · 后训练 · 数据标注 · 智能体 · 预训练 · 轨迹数据 · SFT · 评分标准
