奖励模型
Reward Model
学习人类偏好并给模型回答打分的辅助模型。
像一位学会评分标准的评委。
这个比方用于帮助入门,并不覆盖技术实现的所有细节。
偏好训练、候选回答排序和模型对齐。
先从实际任务理解概念,比死记英文缩写更有效。
评分标准有偏差,优化结果也会带入这种偏差。
如果这个概念会影响费用、数据或安全,请继续查看官方文档。
Reward Model
这个比方用于帮助入门,并不覆盖技术实现的所有细节。
先从实际任务理解概念,比死记英文缩写更有效。
如果这个概念会影响费用、数据或安全,请继续查看官方文档。