白话 AI 小百科
← 返回百科索引
训练与定制 · 30 秒看懂

奖励模型

Reward Model

一句人话

学习人类偏好并给模型回答打分的辅助模型。

打个比方

像一位学会评分标准的评委。

这个比方用于帮助入门,并不覆盖技术实现的所有细节。

什么时候需要它

偏好训练、候选回答排序和模型对齐。

先从实际任务理解概念,比死记英文缩写更有效。

别混淆

评分标准有偏差,优化结果也会带入这种偏差。

如果这个概念会影响费用、数据或安全,请继续查看官方文档。