K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

K-文化术语词典报道中常见的技术词

Fine-tuning

让已经做好的模型针对特定任务「再接受训练」,更像是修改成衣,而不是重新量身定制。

简单来说

Fine-tuning(微调)是指让已经做好的模型针对特定用途「再接受训练」。如果从零开始训练新模型是量身定制西装,那微调就是修改成衣——买一件不错的衣服(通用模型)回来,只是把袖子改短一点,让它更合身(适配自家公司的业务)。

具体做法是喂给模型准备好的示例数据。用几千份医疗问诊记录做微调,就能得到一个说话带医疗腔调、懂医疗知识的模型;用自家公司的客服记录做微调,就能得到一个按公司风格回答的模型。这比从头训练整个模型便宜得多。

在报道中,这个词通常出现在两种语境里:企业宣布「打造了自己的微调模型」的应用案例,以及基于开源模型微调而来的衍生模型(比如「基于Llama的韩语专用模型」)发布的消息。值得记住的是它和RAG的区别——RAG是换了参考资料答案就跟着变,而微调则是让知识真正「刻进」模型本身。

在报道中是这样出现的

「把开源模型用自家数据做微调,成本降到了原来的十分之一。」——这是典型的应用报道:与其用大厂的API,不如自己动手改一件成衣。

微调与检索增强生成有什么不同

是否改造模型本身, 是否在回答前先给它参考资料

「我们用公司资料训练了AI」这句话两边都会用到,但方式完全不同。一种是重新训练模型本身、改变其内在特性;另一种是模型保持不变,每次提问时去找相关文档一起提供给它。公司说「做个内部聊天机器人」时,通常需要的是后者。

对比项Fine-tuningRAG
改变的是什么重新训练模型本身模型不变,改变的是提供给它的资料
擅长的事让语气、格式、特定领域的感觉内化准确回答最新事实和公司内部文档相关问题
资料变动时需要重新训练,耗费时间和金钱只需替换文档即可立即生效
能否说明出处无法指出是从哪里学到的可以展示查到的文档作为依据
比喻培训员工把资料放在员工的桌上

判断方法如果问题在于语气和格式,就是微调;如果问题在于知道什么内容,就是检索增强生成。

微调与LoRA,区别在哪

重新训练整个模型, 只训练额外附加的小部分

LoRA本身就是微调的一种方式,所以「该用哪个」这个问题本身就有点问错了。准确地说,微调是大类,LoRA是在这个大类里低成本实现的一种方法。现在文章里说「做了微调」,大多数情况下实际指的是LoRA。

对比项Fine-tuningLoRA(Low-Rank Adaptation)
训练什么模型内部的全部参数只训练附加上去的小部分
成本需要企业级设备已经降到个人电脑也能跑的程度
产出会生成一整套全新的模型原模型保持不变,只生成一个小文件
替换方式必须整体替换模型只替换小部分,可以轮流切换使用多个
比喻重新做一件衣服在衣服上打补丁

判断方法微调是目的,LoRA是低成本实现这个目的的方法——这不是二选一的问题。

相关词条

出现过这个词的报道

目前还没有报道用到这个词。有新报道时会自动出现在这里。

浏览全部词条