量化
Quantization
通过降低模型数字精度来瘦身的压缩技术——让LLM能在手机上运行的秘诀。
简单来说
量化是一种压缩技术,通过降低模型内部数字的精度来减少体积和运算量。比如把原本用16位小数存储的权重降到4到8位整数——就像把照片画质调低一档,从而大幅缩小文件体积。
关键在于,精度降低后性能几乎不受影响。LLM能在笔记本电脑、手机上运行,社区能在个人电脑上跑开源模型,这些都要归功于量化技术。看到「发布4比特量化版本」这样的说法,可以理解为「现在可以在自家电脑上跑了」。
蒸馏和量化,区别在哪
是否降低现有模型的精度, 是否重新训练一个更小的模型
两者都被说成是「让模型变轻」,看起来像同一种技术。但其实一个是让小模型向大模型学习、单独训练出来的过程,另一个是把已有模型的数字精度调粗、只是缩小体积。两者也常常一起用——先蒸馏出小模型,再用量化进一步压缩。
| 对比项 | 量化 | 蒸馏 |
|---|---|---|
| 做什么 | 减少模型数字的位数 | 以大模型为老师,训练出一个小模型 |
| 结果 | 得到同一模型的轻量版本 | 得到一个与原模型不同的新模型 |
| 代价 | 只需转换,速度快得多 | 需要训练,耗费时间和设备 |
| 损失的东西 | 精度被削减,答案略显模糊 | 能力比不上老师模型 |
| 在报道中 | 「可在手机上运行的4比特版本」 | 「发布了从大模型蒸馏出的小模型」 |
判断方法出现新模型就是蒸馏,同一模型变轻就是量化。
相关词条
出现过这个词的报道
目前还没有报道用到这个词。有新报道时会自动出现在这里。