模型蒸馏与小模型:更低成本跑出够用的效果

运营GO 编辑部

不是所有任务都要砸大模型。把大模型的能力”蒸馏”进小模型,推理成本能砍掉九成,延迟还更低,很多业务场景够用得很好。

快速结论

  • 蒸馏是让小模型学大模型的输出分布,而非死记硬背标签。
  • 小模型胜在便宜、快、能本地跑,适合高频简单任务。
  • 蒸馏要配真实验证集,别只看准确率一个数字。
  • 不是越小越好,关键看任务复杂度和可接受误差。

蒸馏到底在做什么

普通训练只教小模型”标准答案是什么”。蒸馏额外教它”大模型对各选项的信心分布”,比如大模型判 A 90%、B 8%。这种软标签携带了”为什么”的信息,小模型学得更像老师的判断逻辑。

直观比喻:背书是记结论,看老师解题过程是学思路。蒸馏给的就是思路,所以同样数据量下,蒸馏出的小模型泛化往往比纯硬标签训练的好,尤其在边界样本上。

什么时候该用小模型

高频、简单、延迟敏感的任务最适合:分类、打标、简单抽取、意图识别。这些活大模型能做,但杀鸡用牛刀,成本和延迟都不划算。小模型在它们身上又快又省。

反过来,开放生成、复杂推理、需要广博知识的活,小模型容易露怯。判断标准就一条:这个任务需不需要”想很多步”。想得多的留给大模型,想得少的尽量小模型。

成本账怎么算

大模型按 token 计费的场景,把其中六七成简单请求路由给小模型,账单能降一大截。小模型单次推理成本常是大模型的十分之一甚至更低,量越大省得越多。

还有延迟账:小模型参数量小,响应常快几倍,对实时交互(如输入框即时建议)体验提升明显。成本加体验两本账合起来,蒸馏的回报很实在。

蒸馏不是只看准确率

只盯准确率会踩坑:小模型可能在平均准确率上接近老师,但在某几类长尾样本上惨败。验证集要覆盖业务真实分布,按场景分层看指标,而不是被一个总数字糊弄。

还要看错误类型。分类任务里,把”重要客户”误判成”普通”的代价,远高于普通互误。蒸馏时给重要类加权重,让小模型先保住高代价正确的那部分。

本地部署的额外收益

小模型能跑在笔记本甚至手机上,数据不出设备。对隐私敏感的场景(如本地文档处理),这比调用云端大模型合规得多,也不依赖网络。

本地化还带来稳定:不依赖外部服务可用性,离线也能跑。对工业现场、内网环境,这是小模型相对大模型的硬优势,和成本无关。

蒸馏的常见做法

实务有两条路。一是用老师模型对训练集打软标签,小模型在这些软标签上训练;二是让小模型直接模仿老师的隐藏状态或中间输出,学得更快但实现更复杂。

起步建议走软标签路线:把现有标注数据过一遍大模型拿概率分布,再用这份增强数据训小模型。改动小、收益明显,是性价比最高的入门做法。

和大模型怎么搭配

稳妥架构是”小模型打头、大模型兜底”:小模型先处理,信心高直接出结果,信心低转大模型。这样既保了成本,又不丢复杂case的准确率。

路由本身也要设计:用置信度阈值或一个简单的分类器决定谁上。把路由调好,整体成本和质量的平衡点才找得准,而不是一刀切全用小或全用大。

三个容易踩的坑

坑一:蒸馏数据和老师训练数据分布不一致,小模型学偏。坑二:只优化总准确率,忽略长尾和重要类错误。坑三:盲目追最小,结果关键场景频繁转大模型,省了个寂寞。

三者都靠”用真实业务数据验证、按场景分层看指标、路由兜底”来化解。蒸馏是工程活,不是训完就完。

选型清单

动手前问四句:任务要不要多步推理?量有多大?延迟要求多严?数据能否出域?四句答完,小模型适不适合基本清楚,不至于盲目上蒸馏。

如果答案偏向”简单、量大、要快、要本地”,那就坚定走小模型+蒸馏;反之把预算留给大模型,别为了省而省。

上线与监控

小模型上线后监控两类漂移:数据分布变了导致准确率下滑,以及老师模型升级后学生没跟上。建一条”老师定期重标、学生定期重训”的流水线。

还要保留回滚:新蒸馏版本指标劣化能一键回退旧版。模型会老化,监控和回滚是蒸馏能长期稳跑的底线。

蒸馏效果的真实案例

一个常见落地是客服意图识别:原本用大模型逐条判,成本高且慢;蒸馏出小模型后,九成简单咨询在本地毫秒级分类,只把少数复杂件转给大模型。

另一个场景是内容审核初筛,小模型先拦明显违规,大模型只复核边界样本。成本降下来的同时,人工和大模型都把精力花在刀刃上,整体吞吐反而更高。

核心要点大模型教师产生软标签小模型学生学分布省成本推理更便宜看场景不是越小越好

图:蒸馏与小模型 核心要点(运营GO 整理)

维度大模型蒸馏小模型
成本低至 1/10
延迟较高
适用复杂推理高频简单
部署多云端可本地

延伸阅读:什么是 Prompt(提示词)什么是 MCP(模型上下文协议)

下一步行动清单

  • 先判断任务要不要多步推理,简单的坚决上小模型。
  • 用老师模型打软标签,小模型在这些数据上训。
  • 验证集覆盖真实分布,按场景分层看指标。
  • 小模型打头、大模型兜底,置信度路由。
  • 建老师重标、学生重训的流水线并保留回滚。

相关阅读