Fine-tuning
让已经做好的模型针对特定任务「再接受训练」,更像是修改成衣,而不是重新量身定制。
简单来说
Fine-tuning(微调)是指让已经做好的模型针对特定用途「再接受训练」。如果从零开始训练新模型是量身定制西装,那微调就是修改成衣——买一件不错的衣服(通用模型)回来,只是把袖子改短一点,让它更合身(适配自家公司的业务)。
具体做法是喂给模型准备好的示例数据。用几千份医疗问诊记录做微调,就能得到一个说话带医疗腔调、懂医疗知识的模型;用自家公司的客服记录做微调,就能得到一个按公司风格回答的模型。这比从头训练整个模型便宜得多。
在报道中,这个词通常出现在两种语境里:企业宣布「打造了自己的微调模型」的应用案例,以及基于开源模型微调而来的衍生模型(比如「基于Llama的韩语专用模型」)发布的消息。值得记住的是它和RAG的区别——RAG是换了参考资料答案就跟着变,而微调则是让知识真正「刻进」模型本身。
在报道中是这样出现的
「把开源模型用自家数据做微调,成本降到了原来的十分之一。」——这是典型的应用报道:与其用大厂的API,不如自己动手改一件成衣。
微调与检索增强生成有什么不同
是否改造模型本身, 是否在回答前先给它参考资料
「我们用公司资料训练了AI」这句话两边都会用到,但方式完全不同。一种是重新训练模型本身、改变其内在特性;另一种是模型保持不变,每次提问时去找相关文档一起提供给它。公司说「做个内部聊天机器人」时,通常需要的是后者。
| 对比项 | Fine-tuning | RAG |
|---|---|---|
| 改变的是什么 | 重新训练模型本身 | 模型不变,改变的是提供给它的资料 |
| 擅长的事 | 让语气、格式、特定领域的感觉内化 | 准确回答最新事实和公司内部文档相关问题 |
| 资料变动时 | 需要重新训练,耗费时间和金钱 | 只需替换文档即可立即生效 |
| 能否说明出处 | 无法指出是从哪里学到的 | 可以展示查到的文档作为依据 |
| 比喻 | 培训员工 | 把资料放在员工的桌上 |
判断方法如果问题在于语气和格式,就是微调;如果问题在于知道什么内容,就是检索增强生成。
微调与LoRA,区别在哪
重新训练整个模型, 只训练额外附加的小部分
LoRA本身就是微调的一种方式,所以「该用哪个」这个问题本身就有点问错了。准确地说,微调是大类,LoRA是在这个大类里低成本实现的一种方法。现在文章里说「做了微调」,大多数情况下实际指的是LoRA。
| 对比项 | Fine-tuning | LoRA(Low-Rank Adaptation) |
|---|---|---|
| 训练什么 | 模型内部的全部参数 | 只训练附加上去的小部分 |
| 成本 | 需要企业级设备 | 已经降到个人电脑也能跑的程度 |
| 产出 | 会生成一整套全新的模型 | 原模型保持不变,只生成一个小文件 |
| 替换方式 | 必须整体替换模型 | 只替换小部分,可以轮流切换使用多个 |
| 比喻 | 重新做一件衣服 | 在衣服上打补丁 |
判断方法微调是目的,LoRA是低成本实现这个目的的方法——这不是二选一的问题。
相关词条
出现过这个词的报道
目前还没有报道用到这个词。有新报道时会自动出现在这里。