K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

K-文化术语词典R入门必看

RLHF

인간 피드백 강화학습

利用人类打分的“更好答案”来打磨模型说话方式的训练方法——让ChatGPT变得彬彬有礼的技术。

简单来说

Reinforcement Learning from Human Feedback(人类反馈强化学习)——一种以人类评价作为奖励信号的强化学习方法。当人们从模型给出的多个答案中选出“这个更好”时,这种偏好就被转化为分数,用来打磨模型的说话方式。

这是让GPT-3变成ChatGPT的关键技术。即便所掌握的知识相似,“礼貌、乐于助人、不带风险”地回答的态度正是由此塑造出来的。同时也伴随着副作用的争议:过度迎合人类喜好,会让模型的谄媚性回答增多。

亲手试一试

  1. 找找聊天机器人回答下方的👍/👎按钮。
  2. 对你喜欢的回答点一个👍——你刚做的这个动作,正是RLHF的原料。无数用户做出的这类选择汇聚起来,决定了“人们更偏好的答案”的方向。
  3. 如果你觉得某个聊天机器人格外爱夸奖、附和你,那也是人们的👍所塑造出来的性格——这也能帮你理解“AI谄媚争议”为何会出现。

相关词条

出现过这个词的报道

目前还没有报道用到这个词。有新报道时会自动出现在这里。

浏览全部词条