白话 AI 小百科
← 返回百科索引
训练与定制 · 30 秒看懂

人类反馈强化学习

RLHF

一句人话

用人类偏好反馈让模型更符合有用、安全等目标。

打个比方

不只判对错,还让老师比较哪个回答更好。

这个比方用于帮助入门,并不覆盖技术实现的所有细节。

什么时候需要它

理解聊天模型为何比原始模型更会配合。

先从实际任务理解概念,比死记英文缩写更有效。

别混淆

偏好训练会带入标注标准和价值取舍。

如果这个概念会影响费用、数据或安全,请继续查看官方文档。