这张卡讲蒸馏——把大模型能力装进小模型的实用路径——的机会与边界。
核心拆解:蒸馏用大模型生成或标注训练数据,再训练小模型逼近其行为,交付价值是把推理成本压一个量级并把能力留在私有环境。关键认知:蒸馏的是行为不是理解——小模型学到大模型的输出分布,不代表学到推理能力,分布之外的输入上会露馅。最常见的误用是拿蒸馏模型接手大模型全部任务域,边界没划就上线,尾部场景静默劣化。
增量判断:与监督微调的工程关系:蒸馏常以监督微调为训练手段,蒸馏回答数据从哪来,监督微调回答怎么训。国内私有化语境对蒸馏需求旺盛——小模型好部署、好审批,FDE 要在方案里写清能力边界与评测证据。
行动建议:蒸馏前先按任务域统计大模型的输出分布,划出小模型不接手的尾部清单。边界清单要随每次再训练重新确认。
—— FDEChina编辑部 · 实战派
定义
蒸馏(Distillation)指用大模型生成或标注训练数据,再训练一个更小的模型去逼近大模型行为的技术,交付价值是把推理成本压低一个量级,同时把能力留在可私有部署的载体上。
展开
关键认知是蒸馏的是行为而非理解:小模型学到大模型的输出分布,不等于学到了它的推理能力,在分布之外的输入上会明显露馅,所以蒸馏模型必须划定任务域边界并配评测证据。数据质量决定蒸馏上限——大模型输出的噪声会被小模型忠实继承,做数据清洗与难度分层比调训练参数更值。与微调、监督微调的关系:监督微调是训练手段,蒸馏是数据来源策略,两者常组合成「用大模型产数据、监督微调训小模型」的完整路径;与提示词工程的方向差异是,蒸馏改变参数、把能力固化进模型,不再依赖每次调用的上下文。国内私有化语境下蒸馏需求旺盛:小模型部署门槛低、审批链路短,FDE 要把能力边界、覆盖度评测与升级路径写进方案,避免客户把蒸馏模型当成全能替代。