蒸馏
Distillation
把大模型的能力转移到小模型上的技术——「教师模型→学生模型」。
简单来说
先让又大又贵的「教师模型」大量生成答案,再用这些答案训练又小又便宜的「学生模型」去模仿。这种做法就像把知识「蒸馏」出来,重新灌装进新的容器,因此得名。
手机上运行的许多小型模型都是这样制造出来的。这个词也是行业纠纷的焦点——各公司之间常互相指控对方偷偷大量抓取自己前沿模型的回答,用来训练自家的学生模型。所谓「蒸馏争议」的报道,说白了就是「抄袭学习」的指控。
蒸馏和量化,区别在哪
是否重新训练一个更小的模型, 是否降低现有模型的精度
两者都被说成是「让模型变轻」,看起来像同一种技术。但其实一个是让小模型向大模型学习、单独训练出来的过程,另一个是把已有模型的数字精度调粗、只是缩小体积。两者也常常一起用——先蒸馏出小模型,再用量化进一步压缩。
| 对比项 | 蒸馏 | 量化 |
|---|---|---|
| 做什么 | 以大模型为老师,训练出一个小模型 | 减少模型数字的位数 |
| 结果 | 得到一个与原模型不同的新模型 | 得到同一模型的轻量版本 |
| 代价 | 需要训练,耗费时间和设备 | 只需转换,速度快得多 |
| 损失的东西 | 能力比不上老师模型 | 精度被削减,答案略显模糊 |
| 在报道中 | 「发布了从大模型蒸馏出的小模型」 | 「可在手机上运行的4比特版本」 |
判断方法出现新模型就是蒸馏,同一模型变轻就是量化。
相关词条
出现过这个词的报道
目前还没有报道用到这个词。有新报道时会自动出现在这里。