微调,是拿一个已经训练好的大模型,用你自己的一批针对性数据再训练一小段,让它更贴合某个具体任务或说话风格。它要解决的问题很直接:通用模型什么都懂一点,但对你的行业术语、格式要求或语气往往不够到位,而你又不想、也没条件从零训练一个模型。
一句话定义
微调是在别人训好的模型上继续训练,喂进你的示例,把它的输出往你要的方向拧一点。原模型的通用能力保留,你额外叠加的是对特定数据的适应。和从零训练不同,微调用的数据量小得多、花的算力也少,因为大部分知识模型已经学过了,你只是补上”你这行怎么说话”这一块。
一个例子
假设你要做一个客服助手,回答必须用公司固定的话术和退款政策。你把过去几百条标准问答整理成”问题—标准回答”的成对数据,拿去微调一个开源模型,之后它遇到类似问题就会照你的话术回答,而不给一段通用的客气话。数据里没覆盖的情况,它仍然按原模型的老样子回答——微调改的是倾向,没给它装一套新规则引擎。
和相近概念的区别
微调改的是模型本身的参数,提示词和 RAG 都不动模型。写提示词是每次对话临时给指令,模型事后什么也没记住;RAG 是回答前去外部资料里检索、把找到的内容塞进上下文,适合知识经常更新的场景。微调则把模式焊进模型,适合风格、格式、固定任务这类反复出现、又难用几句提示说清的需求。三者不互斥,实际项目里常常先试提示词,不够再上 RAG 或微调。
什么时候用得上
当你反复要同一种输出风格、而提示词写得再细也不稳定时,就该考虑微调。动手之前,你可以先在 HuggingChat 里试用和比较几个开源模型,看哪个底子更接近你要的效果,再决定拿谁来微调。要注意它部分模型的访问取决于账户方案,可用的模型清单也可能变化、生成内容未必准确,涉及敏感资料或高风险结论时得另外人工核对。如果你的需求只是偶尔问答、或知识天天在变,先别急着微调——提示词或 RAG 往往更省事。