
当 Prompt 已经反复优化模型仍然“懂通用知识却不懂你的业务”时微调才真正进入候选方案。它不是给模型临时补充一段背景而是用一批稳定、可复用的示例改变模型在特定输入下的输出习惯。阅读要点微调解决稳定行为问题专业术语、分类边界、固定风格与任务格式。SFT 的核心是高质量示范数据质量、边界覆盖和评测设计通常比单纯扩充数量更重要。优先从 LoRA-SFT 起步成本低、迭代快只有收益和资源都明确时再考虑 Full-SFT。训练不是终点必须用独立测试集和真实业务指标验证避免“训练集上看起来很好”。一、微调到底在调什么模型微调Fine-tuning常写作 FT是指在预训练模型的基础上继续使用特定任务或领域数据进行训练让模型更稳定地学习目标行为。基座模型已经具备语言与通用知识能力微调负责把这些能力“拧”向具体业务。微调不等于知识库检索。检索增强生成RAG更适合补充经常变化、需要追溯来源的外部知识微调更适合固化分类边界、输出格式、表达风格和决策模式。两者也可以组合RAG 提供事实微调约束模型如何理解和回答。1.1 大模型训练的三个阶段阶段训练信号主要目标预训练大规模文本块学习语言规律、通用知识与基础推理能力SFT输入与标准输出配对学习如何完成任务、遵循指令和贴合业务标准RLHF偏好优化人类偏好、排序或奖励信号减少不受欢迎的输出让回答更符合人类偏好SFT是 Supervised Fine-Tuning 的缩写即有监督微调。它通过“问题—标准答案”示范告诉模型遇到这类输入应当如何判断、解释和输出。二、微调的价值与成本能带来的价值提高特定任务或领域的稳定表现固化回答风格、格式和判断口径减少超长 Prompt降低重复指令成本让小参数模型学习可复用的业务模式必须承担的成本准备、清洗和复核标注数据消耗 GPU、训练时间与实验配额需要持续评测、回归和版本管理低质量数据可能放大错误与偏见因此微调并不是“Prompt 不好用就训练一次”。如果问题来自知识过期优先考虑 RAG如果问题来自流程约束先尝试工作流编排只有目标行为稳定、数据可获得、Prompt 已接近上限时微调的投入才更容易回收。三、一轮微调怎么完成选定基座模型根据任务复杂度、上下文长度、推理成本和部署条件选择 Llama、Qwen、DeepSeek 蒸馏版等开源模型。准备 SFT 训练集收集高质量输入、标准输出并补齐难例、边界样本和易混淆样本。划分验证集与测试集训练集用于更新参数验证集用于调参测试集只用于最终评估三者要避免重复和近似泄漏。设定超参数确定学习率、训练轮数、批次大小、上下文长度以及 LoRA 的秩、缩放系数等。执行训练与评估观察训练损失同时检查业务指标、泛化能力、安全性和输出稳定性。迭代数据与配置效果不理想时先定位失败类型再调整数据、采样比例、Prompt 模板或超参数。冻结版本并上线保存模型、数据版本、训练配置和评测结果完成灰度与回滚准备。实验原则一次尽量只改一个主要变量。数据集、学习率和训练轮数同时变化时即使效果提升也很难知道真正有效的是哪一项。四、SFT 数据决定上限SFT 平台通常支持 CSV、JSON、JSONL 等格式真正影响训练的是样本结构与内容质量而不是文件扩展名。最基础的样本包含 input 和 output对话模型更常使用 messages 结构将 system、user、assistant 按消息顺序组织起来也能表达多轮对话。常见数据格式{ instruction: 用简洁语言解释量子力学, output: 量子力学是描述微观粒子行为的物理理论其核心包括波粒二象性、不确定性原理和量子纠缠等概念... } { instruction: 请将以下英文翻译成中文, input: Artificial Intelligence is transforming the world., output: 人工智能正在改变世界。 } { history: [ [用户推荐几部科幻电影, 助手《星际穿越》《阿凡达》《银翼杀手2049》], [用户这些电影的导演是谁, 助手诺兰、卡梅隆、维伦纽瓦] ], new_input: 他们的获奖情况如何, output: 《星际穿越》获奥斯卡最佳视觉效果奖《阿凡达》获最佳摄影... }{ messages: [ {role: system, content: 你是内容风险分类助手必须依据给定规则输出标签和简短依据。}, {role: user, content: 待判断文本……}, {role: assistant, content: 标签风险类A依据命中规则2。} ] }4.1 好数据的四个标准正确标签、结论和解释符合最新业务规则。一致相似样本使用同一判断口径避免标注员之间互相冲突。有覆盖既有常见样本也有长尾、对抗、模糊和边界样本。无泄漏测试样本及其近似改写不能混入训练集。公开数据集可以在 Hugging Face 等平台上用于熟悉训练流程但业务模型最终仍要依靠贴近真实分布的数据。公开集能教会模型“怎么答题”未必能教会它“你们如何判题”。4.2 数据量与正负样本比例“样本量超过 1,000、正负比例约 1:2”可以作为一次实验的起点但不是通用门槛。合理比例取决于线上真实分布、错误成本和目标指标。如果漏放风险远高于误杀成本训练采样和评测集都应对高风险类别给予更高权重上线评估仍要回到真实流量分布避免离线高分掩盖线上偏差。五、CoT 数据怎样帮助 SFTCoTChain of Thought思维链数据会在答案之外加入中间分析过程。对于规则复杂、分类边界相近的任务合理的推理示范可以帮助模型学习“依据什么判断”而不只是记住标签。人工逐条编写 CoT 成本很高可使用能力更强的大模型辅助生产准备高准确率的分类标签、质检数据或人审数据。把业务规则、判断标准和输出格式写入 system prompt。由大模型生成结构化分析依据和最终答案。通过规则校验、抽样复核和冲突检测过滤低质量样本。用通过验收的数据微调小参数模型。主要风险大模型生成的推理过程可能“答案正确、理由错误”还可能编造并不存在的规则。业务训练更适合保留可核验的短依据、命中规则和关键证据不宜把未经复核的长篇推理直接当作真值。在内容风控任务中可以把 CoT 改造成结构化判定链识别对象 → 命中规则 → 排除例外 → 输出标签。这样更容易检查也方便定位误杀、漏放和规则冲突。六、LoRA-SFT 与 Full-SFT维度LoRA-SFTFull-SFT训练方式冻结大部分原模型参数只训练新增的低秩模块解冻全部参数所有权重参与反向传播与更新资源成本较低显存与存储压力更小较高需要更多 GPU 和训练时间迭代速度快适合多轮业务实验慢训练和版本管理更复杂能力改造适合风格、格式和领域任务适配可进行更深的参数调整但风险也更高推荐场景大多数业务 SFT 的首选起点数据充分、收益明确且 LoRA 已触顶的场景对多数分类、抽取、风格定制任务LoRA-SFT 的投入产出比更好。Full-SFT 不是“更高级的 LoRA”而是一种成本和风险都更高的训练选择。七、超参数怎么理解超参数控制什么常见问题Learning Rate每次参数更新的步幅过大可能震荡或破坏原能力过小则收敛慢Epochs训练集被完整学习的次数过多容易过拟合过少可能尚未学会任务Batch Size一次更新使用的样本数量受显存限制也会影响梯度稳定性Context Length单条样本可使用的最大 Token 数过短会截断信息过长会明显增加成本LoRA Rank低秩模块的表达容量过小可能学不够过大会增加参数与过拟合风险超参数会影响效果但它们救不了错误标签。发现模型在某一类规则上持续出错时先检查数据覆盖和标注一致性再调整学习率或训练轮数。八、什么项目适合微调一个值得启动 SFT 的项目通常同时满足以下条件Prompt 已迭代到较好版本继续增加规则只会让提示词更长、更脆弱。任务目标稳定短期内不会频繁修改标签体系和判断标准。已有一批高质量标注数据并能持续获得人审或质检反馈。能建立独立评测集明确误杀率、漏放率、F1、准确率或格式合规率等指标。收益可以覆盖训练、部署、回归评测和后续维护成本。典型场景包括医疗、法律、金融等专业领域适配文本分类、情感分析、信息抽取等特定任务以及幽默、正式、古风等稳定风格定制。对内容风控而言更常见的目标是让模型学习规则边界、风险标签和简洁可审计的判断依据。九、评测比训练更容易被低估训练损失下降只能证明模型更贴合训练数据不能证明业务效果已经提升。评测至少要覆盖整体准确率、Macro-F1以及每个类别的 Precision 和 Recall。输出格式合规率、理由与标签一致率、推理时延和调用成本。与基座模型、Prompt 方案及上一版微调模型的同集对比。最有价值的不是一个总分而是失败样本归因模型没学会规则、数据定义冲突、上下文被截断还是类别分布失衡。归因决定下一轮应该改数据、改 Prompt还是改超参数。十、平台与服务容量指标含义餐厅类比RPM每分钟允许的请求次数一分钟能接待多少桌客人TPM每分钟允许处理的 Token 总量厨房一分钟能处理多少份食材QPS每秒允许的查询次数餐厅每秒能接住多少位新客三者不能互相替代。即使 RPM 没到上限单次输入过长也可能先撞到 TPM即使 TPM 足够瞬时并发过高仍可能触发 QPS 限制。模型上线前要用真实长度分布和峰值流量压测而不是只看平均值。一条更稳妥的实践路径是先用 Prompt 建立基线再用高质量 SFT 数据突破稳定性瓶颈最后用独立评测和线上灰度证明收益。对大多数业务团队而言这比一开始追求更大的模型或更重的训练方式更有效。