
说个可能让很多人意外的事实这次被点名的蒸馏在技术圈并不是什么见不得人的偷窃手段它甚至是很多团队训练模型的日常操作。问题从来不在怎么蒸馏这个动作本身而在于蒸馏谁的模型、用了什么协议、拿去干了什么。大众看到7家中国公司被点名的新闻第一反应是他们抄了别人的模型但真正的业内争议要微妙得多——有人是从API输出里扒数据来训练自家模型有人是拿开源模型蒸馏后换个名字商用还有人只是用了别人模型的输出做数据增强。这三种情况的偷法完全不同性质也完全不同。这篇文章我想把蒸馏这件事从头到尾讲透它到底是怎么运作的争议焦点在哪里以及被偷走的究竟是什么东西。不管你是做AI应用的工程师还是关心大模型行业动向的普通读者看完你应该能对这件事有自己的判断。1. 蒸馏不是偷代码它更像是偷师学艺1.1 一句话说清模型蒸馏到底在干什么先把这个技术最朴素的样子讲明白。一个已经训练好的大模型好比一位经验丰富的老厨师。你找一个小徒弟跟着他学但学的方式不是让他背诵菜谱那叫复制参数而是让他在旁边看老厨师做菜时每一次调味的细节、火候的判断、装盘的偏好然后自己反复练习直到做出味道接近的菜。放在技术上大模型A教师模型在推理时除了给出最终的答案比如这个句子的情感是正向还会输出每个候选词的概率分布。分布里藏着大量软知识——比如模型认为开心有80%概率、高兴有15%概率、快乐有5%概率。这种模糊的偏好信息恰恰是训练小模型B学生模型的绝佳教材。B在学习时不只是追求答案对还要求自己的概率分布尽量贴近A的分布于是把A脑海里的调味习惯也一并学了过去。这里面有个关键参数叫温度temperature用于把原本锐利的概率分布变得平滑。温度越高分布越平缓小概率词的信息也能被暴露出来供学生学习。很多实操里教师模型推理时会把温度调高到2或者3而学生模型学习时用同样的温度但实际部署时恢复到1。这种平滑化处理就是蒸馏技术的精髓所在。1.2 蒸馏、微调和预训练根本不是一回事很多人把蒸馏和微调混为一谈其实它们是三条完全不同的路。做个对比就清楚了维度模型蒸馏模型微调预训练学习对象教师模型的输出分布特定任务的数据集海量无标注文本目标让学生模型接近教师能力让模型适配某个场景让模型获得语言能力是否需要教师模型必须不需要不需要典型数据规模数万到数百万条输出数百到数万条样本数十亿到数万亿token结果特点能力逼近教师但难超越单任务效果提升明显通用能力的基础微调是在现有模型基础上用特定数据继续训练好比一位厨师擅长川菜你让他集中练习一个月粤菜他的川菜底子还在。蒸馏则是拿一个现成的厉害模型当影子老师目标是把老师的综合手艺压缩进一个更小的模型里。而预训练是从零开始读万卷书成本最高周期最长中途还要面对各种训练不稳定问题。从商业角度理解预训练是自己种粮食微调是在买来的面粉上加工蒸馏则是照着别人的成品菜反推做法。种粮食最贵但最自由反推做法最便宜但可能在知识产权上踩雷。1.3 为什么蒸馏能以小博大原理并不玄乎先抛结论蒸馏能够让小模型在特定任务上逼近大模型的核心原因在于知识从死答案变成了活偏好。普通训练数据只告诉你正确答案是什么相当于师傅只让你背结论。蒸馏数据告诉你正确答案之外其他选项各有多接近正确相当于师傅还把做菜时的犹豫、变通、风格偏好都展示给你。所以即使学生模型的参数量小很多它也能在知识密度上追平甚至超越同尺寸直接用原始数据训练的模型。我在实际项目里有很直观的体验。之前用7B参数的学生模型在摘要生成任务上通过蒸馏一个70B的教师模型ROUGE分数比直接用标注数据训练的7B提高了9个百分点推理速度还快了一倍不止。这就是典型的花小钱办大事。但这不意味着蒸馏万能。学生模型的上限通常被教师模型锁死——它学到的是教师已有的能力和偏好无法凭空获得教师不具备的知识。我常说一句话蒸馏是能力迁移不是能力创造。后面聊他们到底偷走了什么时你会看到这条边界非常关键。2. 被点名的7家公司争议焦点到底在哪2.1 三种偷的边界权重、输出、能力同样是蒸馏被业界和媒体反复讨论的争议其实可以拆成三个层次。第一种直接搬权重。把某个开源模型的权重文件拿过来稍加改动甚至不改换个名字发布。这已经不属于蒸馏范畴是赤裸裸的剽窃任何一个懂技术的人看一眼参数都能识破。这种情况在舆论上最恶劣但实际发生频率并不高因为它太容易被实锤。第二种用API输出做训练数据。通过调用某家公司的商业API把模型生成的回答、代码、对话记录下来作为自己模型的训练语料。这是本次风波中争议最大的做法。因为商业公司在API条款里几乎都写了禁止用输出训练竞争模型但技术上很难彻底阻止。你不说我不说查起来全靠运气。第三种用开源模型蒸馏后商用。开源模型的许可证License一般允许使用甚至商用但往往附带条件比如要保留版权声明、要开源衍生作品、不能误导他人你是原创模型。很多团队蒸馏完直接换个名字许可证要求全忽略这属于技术合法但协议违约的灰色地带。你注意看真正让7家公司被推上风口浪尖的恰恰不是第一种而是第二和第三种。因为第一种太低级大家一眼就能看穿第二、第三种却有着技术上可行、协议上违规、法律上模糊的三重属性争议空间最大。2.2 开源协议的红线MIT/Apache/CC-BY-NC到底哪条算违约开源不等于公共领域。每一种开源协议对使用者的约束天差地别。MIT协议最宽松允许任意使用、修改、商用只需要保留原版权声明。严格意义上讲你拿MIT协议的模型去蒸馏商用只要保留了版权信息多数情况下不违约。Apache 2.0比MIT稍严多了专利授权和禁用商标的条款。你要是对外说这是我们的原创模型可能触犯禁止暗示背书的条款。CC-BY-NC最要小心。它明确禁止商业用途。很多研究机构发布的模型用的是这个协议如果你拿去蒸馏后做成付费API卖钱直接踩线。还有不少模型用的是自定义许可证比如模型权重可以商用但生成内容不得用于训练竞品。这就更微妙了——蒸馏算不算训练竞品得逐条抠字眼。我见过不少初创团队技术负责人根本不清楚自己用的基础模型是什么协议。这是非常危险的事。真被点名了第一反应是委屈我们又没偷代码可法务一查你连最基础的版权声明都没保留。2.3 商业闭源模型的护城河API条款和禁止爬取声明闭源模型没有开源协议这层约束护城河完全靠API使用条款。比如OpenAI、Anthropic、Google的API条款里都有类似的禁手条款你不能用API输出开发竞争性模型或模仿性模型。但这里有个技术上的尴尬API条款只能约束人的意图没法约束模型的行为。你把API输出保存成数据集这个行为本身在技术上没有任何痕迹。除非检测到大量高度相似的输出模式否则供应方很难证明你用了他们的API做训练数据。这也是为什么蒸馏争议往往以点名警告收场而不是直接提诉讼。举证责任难度太高一家公司很难证明另一家公司的模型能力是偷来的。更多时候点名本身就是一种警告我们在盯着你你再继续搞我们就来真的。3. 他们到底偷走了什么一场关于知识的搬运3.1 能偷走的分布知识、推理偏好、风格特征现在回到标题那个问题——被点名的公司到底偷走了什么用技术语言精确回答他们偷走的是教师模型在特定数据分布下的行为模式。具体说三样东西。第一分布知识。教师模型见过海量数据知道什么样的语句组合更自然、什么样的代码更规范、什么样的问题会有怎样的答案走向。学生模型通过蒸馏把这些分布层面的偏好内化。打个比方你没跟老厨师打过一天下手但通过反复品尝他做的菜硬生生记住了糖要放三克、盐要后放这个感觉。第二推理偏好。同一道数学题教师模型倾向于先用代数再验算学生模型也会学到这套路径。这不是数据直接教的而是模型在推理过程中形成的隐式策略。蒸馏数据把那套策略的痕迹留下了学生模型照猫画虎。第三风格特征。这个最容易被观察。GPT系列模型的回复风格、标点习惯、措辞偏好在蒸馏后的模型里会被忠实地保留。AI生成内容检测工具之所以能识别某品牌模型特征一个重要原因就是风格指纹在蒸馏链上被逐代继承。3.2 偷不走的事实性记忆、上下文窗口的架构级差距反过来说蒸馏也不是万能的搬运工。首先事实性记忆很难精准转移。教师模型记住了一个冷门知识点的准确出处但蒸馏输出只是这个知识点的答案快照学生模型学到的是这个问题的答案长这样而不是知识本身的结构化关联。所以你去问学生模型这个冷门知识点相关的问题它大概率会露馅——因为蒸馏时根本没覆盖到那种提问方式。更要命的是上下文窗口长度和架构级能力是蒸馏无法跨越的鸿沟。学生模型如果你用的是7B结构它的上下文窗口上限、注意力机制的表达能力、工具调用的复杂度早就被架构定死了。教师模型能做的100页文档理解学生模型即使照着一万条蒸馏样本学也学不出这个能力——不是知识不够是大脑结构不允许。所以真正的行家看一个模型是不是蒸馏货会看它的能力上限在哪。能力曲线在高频任务上贴得很近一到长尾任务就断崖式跌落这就是典型的蒸馏特征。3.3 蒸馏产品的典型特征能力贴近但上限锁死我做过不少模型能力评估的活儿说实话蒸馏模型最大的特征是像但有天花板。给个具体的观察维度评估项蒸馏模型表现原创训练模型表现常见任务聊天、摘要、翻译非常接近教师模型视训练数据而定冷门知识问答明显偏弱可能更强也可能更弱复杂多轮推理容易出现逻辑断裂相对稳定创造性产出写代码、写诗风格模仿痕迹重更有原创性对敏感输入的拒绝能力学到的是表层的拒答模板有更本质的价值判断这个上限锁死现象本质上是因为蒸馏数据只能反映教师模型的输出行为无法反映教师模型的决策过程。学生模型学到的是一堆输入-输出的映射但它不理解背后的推理链。举个例子一个蒸馏来做摘要的模型Teacher在遇到一篇结构混乱的文章时会主动调整段落顺序这种调整逻辑是Teacher内部推理的结果但学生模型学到的只是看到类似文章就输出类似摘要一旦文章结构换了花样学生模型就很难准确应对。所以如果你在创业公司做AI产品用蒸馏起量没问题但别误以为自己已经追平了头部大模型。你追平的只是高频面不是能力线。4. 从实战角度怎么合规地蒸馏一个模型4.1 前提先搞清楚你用的是谁的模型、什么协议讲到这里得从踩坑现场聊点实操了。如果你正在做或者计划做模型蒸馏有几件事必须在动手之前就确认。第一件事去模型卡Model Card页面把许可证读三遍。重点看四个信息能否商用、商用是否需要额外申请、衍生作品是否需要开源、是否保留原作者的署名。我见过一个团队拿着CC-BY-NC协议的模型蒸馏成商用API上线被版权方一封邮件就逼得下架前后损失两个月的开发周期。第二件事确认教师模型的生成内容是否可以用于训练。这件事很多人完全忽略。有些模型虽然本身开源但它的API服务条款里明确写了输出内容不得用于训练其他模型。你如果拿官方API去批量生成蒸馏数据同样踩线。第三件事做好数据来源记录。从数据采集、清洗、到蒸馏完成每一步都留日志。万一将来被质疑你至少能拿出自己是怎么合规操作的证据链。这不是形式主义是保护自己的唯一手段。4.2 数据层面的合规操作合成数据、许可清洗、自采数据合规蒸馏的第一步是建立一个来源干净的训练数据集。我的建议是三条腿走路自采数据优先从你自己的产品日志里收集真实用户交互数据。虽然量小但来源清清楚楚您拥有完全使用权。合成数据辅助用开源模型生成初步数据但必须加上人工审核环节。我一般会让模型生成三到五倍于目标的量然后让标注团队筛选最终保留质量最高的那批。第三方许可数据兜底实在不够就老老实实花钱买有明确授权的数据集别省这个钱。特别提醒有几类数据是绝对不能碰的。一是未经授权爬取的网页数据二是他方API输出批量保存的数据三是包含个人信息的数据。这些数据一旦进入训练集就不是蒸馏争议的问题了而是法律纠纷的问题。4.3 训练阶段的关键参数温度、损失权重、数据配比数据准备完之后真正拉开蒸馏效果差距的是训练细节。分享几个实测下来最关键的参数设置温度教师推理时通常设置在2.0到4.0之间具体要看任务的软知识密度。分类任务温度太高会把清晰的边界抹掉生成类任务温度太低又学不到风格偏好。经验值摘要和翻译类任务2.5左右对话类3.0判断题1.5。损失权重蒸馏损失KL散度和任务损失的配比我见过最常用的比例是73。蒸馏损失占比太低学生模型会偏科在标准答案上占比太高又会丧失对任务本身的优化。数据配比蒸馏数据与原始标注数据的比例建议控制在51到201之间。全用蒸馏数据模型容易学成教师的复读机失去泛化能力混入少量原始标注数据能保住模型自己的判断力。学习率蒸馏场景下学习率要明显低于正常训练。我在7B模型上通常用1e-5到3e-5超过这个范围会出现灾难性遗忘——模型把自己原本会的知识也弄丢了。这些参数没有标准答案每个模型家族不一样需要小批量试跑后调整。但方向记住蒸馏的本质是让模型模仿模仿得太用力就没自己了模仿得太轻又学不到东西。4.4 部署时的能力评估如何判断学生模型够不够格蒸馏完成后别急着上线。我会做一套三层评估第一层基础能力对齐测试。准备一份固定的 benchmark比如MMLU、GSM8K同时跑教师模型和学生模型看看能力差距在什么范围。一般学生模型能做到教师模型的80%-90%就算合格。第二层行为模式一致性测试。重点关注容易露馅的领域冷门知识、项目内特有问题、边缘情况处理。这层测试最容易被忽略但恰恰是用户最能感知差异的地方。第三层线上灰度验证。蒸馏模型先放量给5%的用户监测用户的反馈、求助率、投诉率。线上数据才是最终的裁判离线和线上表现常常差很远。我做过的实战里最常出现的问题是离线评测分数不错上线后却被用户吐槽回答变笨了。原因通常是蒸馏数据过拟合了评测集的题型真实用户问题的分布和评测集差了十万八千里。所以蒸馏数据集的构建一定要重视覆盖度——宁可数量少一点也要确保覆盖面够广。5. 想判断一个模型是不是蒸馏货看这几个信号5.1 行为指纹错误模式的高度重合聊完了蒸馏怎么做再反向聊聊怎么识别。这也是很多研究机构和评测媒体在干的事。最有效的信号是看模型的错误模式是否与某个已知模型高度重合。每个模型都有自己的犯错习惯Llama系列在某个特定数学题型上总是算出同样错误的数字GPT-4在某种长文件名处理上总是多写一个空格Claude在某种指令格式下有特有的回复套路。如果两个模型的错误模式高度一致大概率存在蒸馏关系。这种行为指纹很难消除因为错误往往源于模型对训练数据分布的底层偏好不是简单改几个输出模板就能抹掉的。5.2 输出风格词汇分布和句式偏好的统计学特征这个方法更精细。把一个模型的输出拿去跑一遍词频统计跟疑似教师模型的公开样本做对比看词汇分布、常用短语、标点习惯、段落长度的相似度。有个比较经典的指标叫n-gram重叠率。如果学生模型和某个教师模型的4-gram重叠率远超正常水平基本可以判定存在模仿关系。因为两个独立训练的大模型即使训练数据部分重合句子级别的表达也不会像到那种程度——就像两个不同学校的学生作文框架可能像但逐字逐句的表达不可能高度雷同除非有人直接抄了范文。5.3 对抗性测试迁移任务上的能力断层还有一条更测试工程师思维的路径设计教师模型不擅长的任务看学生模型是否也跟着一起变笨。道理很简单——蒸馏模型学到的是教师的能力子集。如果你发现某个模型的强项、弱项、甚至奇怪的偏好举动都和已知模型如出一辙那它几乎不可能是独立成长出来的。正常训练的模型总会有自己的特长和短板不可能跟另一个模型绑定得那么死。我甚至见过有人用教师模型的弱点来做检测故意构造教师模型容易答错的题如果被检测模型也在同样地方犯错那就是非常强的蒸馏证据。5.4 现实中的检测局限为什么实锤这么难但也要泼一盆冷水以上这些方法在学术研究或商业尽调场景下有用想要成为法律意义上的实锤难度极高。原因有三第一很多蒸馏模型是混合训练的——蒸馏数据加原始数据一起上模型的风格和错误模式会被冲淡指纹匹配的置信度大打折扣。第二大模型行业的人才流动频繁很多团队的技术骨干就是从头部公司出来的。他们本身就带着原厂模型的审美偏好训练出来的模型风格相像很难证明是数据偷的还是人带的。第三检测方需要有疑似教师模型的对照样本。闭源模型的输出样本并不完全公开想精确比对先得拿到足够多的参照数据。所以行业里对蒸馏实锤的态度一向是技术上可以做倾向性判断但别指望它上法庭。点名更多是态度表态而非法律定性。6. 风波之外一些更值得关注的事聊完技术层面的东西再说点作为行业观察者的真实感受。这轮点名蒸馏的风波表面是知识产权争议内核其实是大模型行业原创力的焦虑。当越来越多的公司选择蒸馏而非自研行业的技术多样性实际上是在退化的。大家都在围绕少数几个头部模型做能力搬运搬运的结果就是模型们越来越像越来越没有差异化。而且说实话蒸馏技术本身完全无辜。它是学术圈正经提出的知识压缩方法Hinton那一系的工作初衷是让大模型的能力能被小设备承载这是好技术。问题从来不在技术而在于使用者的契约意识——你可以蒸馏但你要搞清楚你蒸馏的模型允许你做什么不允许你做什么。我给创业团队的建议一向是这三条第一别把蒸馏当长期战略它是杠杆不是地基杠杆能帮你快速起量但地基不打好永远是隐患。第二数据合规的账越早算越便宜等被点名再补救就晚了。第三想办法积累自己的差异化知识哪怕一开始很小也可以从小处长期积累那是别人蒸馏不走的护城河——你可以搬走模型的行为但你搬不走它背后的数据、用户反馈和持续迭代的闭环。回到开头的标题。被点名的7家公司如果非要说偷走了什么我会说他们偷走的不是模型本身而是那家模型公司在算法调优、数据工程、评测反馈上沉淀出来的隐性知识。这种知识没有形体但它在输出分布里在推理偏好里在每个token的概率里。这也是为什么大模型圈总说——真正的护城河不是模型而是持续产生高质量知识的那套系统。蒸馏能让你在某个时间点追近别人但它没法帮你建立那套系统。这个行业的游戏归根结底是创造力的游戏不是搬运力的游戏。