人类反馈强化学习
RLHF
用人类偏好反馈让模型更符合有用、安全等目标。
不只判对错,还让老师比较哪个回答更好。
这个比方用于帮助入门,并不覆盖技术实现的所有细节。
理解聊天模型为何比原始模型更会配合。
先从实际任务理解概念,比死记英文缩写更有效。
偏好训练会带入标注标准和价值取舍。
如果这个概念会影响费用、数据或安全,请继续查看官方文档。
RLHF
这个比方用于帮助入门,并不覆盖技术实现的所有细节。
先从实际任务理解概念,比死记英文缩写更有效。
如果这个概念会影响费用、数据或安全,请继续查看官方文档。