K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件›
K-文化术语词典/ㄱ/入门必看
Reinforcement Learning
通过试错来训练的方法:做得好就奖励,做得差就惩罚。AlphaGo背后的核心方法。
不是直接给出标准答案,而是让系统去尝试,做得好就奖励、做得差就惩罚的训练方式。原理和训练小狗一样——喊「坐下」,坐下了就给零食,重复几百万次。
AlphaGo正是靠这种方式征服了围棋,如今它也成了训练语言模型的核心手段。让模型解数学题,答对了就给奖励,以此培养推理能力。「通过强化学习提升了推理性能」已经成了近期各大模型发布时的常见说法。
目前还没有报道用到这个词。有新报道时会自动出现在这里。