K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

K-文化术语词典入门必看

强化学习

Reinforcement Learning

通过试错来训练的方法:做得好就奖励,做得差就惩罚。AlphaGo背后的核心方法。

简单来说

不是直接给出标准答案,而是让系统去尝试,做得好就奖励、做得差就惩罚的训练方式。原理和训练小狗一样——喊「坐下」,坐下了就给零食,重复几百万次。

AlphaGo正是靠这种方式征服了围棋,如今它也成了训练语言模型的核心手段。让模型解数学题,答对了就给奖励,以此培养推理能力。「通过强化学习提升了推理性能」已经成了近期各大模型发布时的常见说法。

相关词条

出现过这个词的报道

目前还没有报道用到这个词。有新报道时会自动出现在这里。

浏览全部词条