Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本
7959点击    2026-07-26 11:25

大模型微调(Supervised Fine-Tuning,SFT)是当前最主流的LLM落地方案。无论是医疗问答、代码生成,还是法律文书,上到千亿参数大模型、下到端侧小模型,几乎都在用SFT做领域适配。


但一个尴尬的事实是:大家都默认SFT“训练完就是学完了”。直到腾讯混元团队对Qwen、LLaMA、OLMo2等多个模型家族(1.8B–14B)和10个数据集做了全面排查,发现每个模型、每个数据集上都有一批训练样本——模型在训练中见过,loss也降下去了,但回头重测就是答不对。平均比例高达15.3%


这就是论文定义的不完全学习现象(Incomplete Learning Phenomenon,ILP)——SFT训练的系统性盲区。


Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本


发表:ACL 2026主会长文(Long Paper,Pages 30186–30213)


背景


场景与痛点


SFT是LLM从“通才”变成“专才”的关键步骤。业界默认做法是:


  • 准备标注数据(QA对、指令-回复对等)
  • 在基座模型上跑SFT训练
  • 看loss曲线收敛了→认为训练完成


但问题在于:loss是全局平均,掩盖了样本间的差异。loss收敛只代表“大部分样本学会了”——那些始终学不会的样本被淹没了。


与之对比,预训练阶段对数据问题的排查非常深入(Dolma、C4等都有专门的数据质量研究),但SFT阶段几乎没人追问“模型到底学会了什么、没学会什么”。


论文做了什么


这篇论文完成了四项工作:


  • 定义ILP——将SFT后无法正确复现训练样本的行为正式命名为“Incomplete Learning”
  • 找到五大根因——不是笼统地说“数据不好”,而是把每个未学会样本对应到一个可解释的原因
  • 提出四步诊断框架——Detect→Attribute→Intervene→Verify,全流程可复现
  • 验证五种干预——证明了CPT补充知识远优于加epoch,且部分根因无法通过SFT本身解决


ILP现象:训练loss收敛后仍有大量样本无法正确复现:


Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本


不完全学习现象示意图——SFT后训练集回测,部分样本在训练过程中并未被有效学习


四步诊断框架一图胜千言:


Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本


三段式诊断框架——检测→归因→干预,覆盖ILP全生命周期


技术方案——四步诊断框架


整个框架分为四个阶段:


Detect(检测)→Attribute(归因)→Intervene(干预)→Verify(验证)


Step 1:检测(Detect)——怎么知道模型“没学会”?


这是最复杂的一步。难点在于:怎么区分“大致理解”和“真正学会”?


SFT通常生成自由文本,这种形式的“答对”太模糊。论文的做法是:


MC转换(Multiple-Choice Conversion):


  • 把每条SFT数据(QA对)用GPT-4转成4选1选择题(1个正确答案+3个干扰项)
  • 四级质量过滤:答案可解性→唯一性→干扰项区分度→人工抽检
  • 极端情况直接丢弃(如正确答案和干扰项太接近无法分辨)


案例:原始数据是“What is the capital of France?→Paris”,转换成:


Q:What is the capital of France?


A. London B. Paris C. Berlin D. Madrid


pass@k指标(k=5):


  • 对每个MC题,用训练好的模型采样5次
  • 只要5次中有1次选对了答案→判定为“已学会”
  • 5次全部选错→判定为ILP样本


这里k=5不是随便取的:温度变化可能带来回答的随机性,pass@5=给了5次机会,比top-1更公允。


三重验证(Triple Validation):


为避免误判,论文做了三层交叉验证:


  • 跨温度一致性:同一样本在T=0.1/0.5/1.0下重新评估,ILP差异<0.5%
  • 重测信度(Kappa=0.89):同一批样本两次独立检测,Cohen’s Kappa高达0.89
  • 跨模型一致性:不同模型家族(Qwen/LLaMA/OLMo2)的ILP判定高度一致


检测流程图:


Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本


MC转换方案——将监督响应转化为选择题格式,消除自由文本评估噪声


Step 2:归因(Attribute)——为什么没学会?


这是全文最核心的贡献。论文提出了一个2×2归因矩阵,纵轴是“基模型是否已掌握该知识”(预训练阶段),横轴是“SFT标签是否正确”(标注质量)。


Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本


两步快速定位:


  • 知识方向判断:在基座模型上做零样本测试→如果基模型能答对,说明“知识已经有了”,问题出在SFT过程的冲突;如果基模型答不对,说明“预训练阶段就缺知识”
  • 训练方向判断:取early-20% checkpoint和late-20% checkpoint,比较:如果先答对后答错→左侧遗忘(IV);如果一直答不对→优化不足(V);如果有多个冲突标签→数据矛盾(III)


最终锁定五大根因:


Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本


2×2归因矩阵:


Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本


2×2归因框架——横轴「基模型是否已知该知识」,纵轴「SFT标签是否正确」


关键发现:ILP与标注质量无关。即使SFT标签正确率超过98%,ILP仍然存在。说明这不是“数据错了”的问题,而是SFT训练机制本身的系统性不足。


另一个惊人发现:ILP与模型规模弱相关。从Qwen-1.8B换到Qwen-14B,ILP仅降低2.1个百分点。也就是说,更大规模的模型并不能显著解决“学不会”的问题——这指向SFT优化机制,而不是模型容量。


Step 3:干预(Intervene)——怎么让模型学会?


论文根据五种根因,设计了对症的五类干预:


Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本


最惊人的对比实验:


CPT(2倍训练量)→ILP降12.5%


加epochs(10倍训练量)→ILP仅降2%


这意味着:拼命加SFT训练轮次几乎没用,真正的瓶颈在于预训练阶段的知识储备。SFT本身存在物理上限,它只能“重新组织”已有知识,无法凭空创造新知识。


Step 4:验证(Verify)——干预真的有效吗?


干预后重新走一遍检测流程,对比干预前后的ILP率:


  • 使用相同的MC转换+pass@5评估
  • 引入最小效应量阈值(min_effect=0.01),防止统计噪声
  • 确保干预收益>统计波动


实验结果


ILP现象确实存在


Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本


数据集中ILP分布:


Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本


CPT引入后医疗、法律、金融等知识密集型领域的准确率持续增长


ILP与模型规模关系极弱


Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本


从1.8B到14B,参数量翻了近8倍,ILP仅降了2.1个百分点。ILP是SFT机制层面的问题,不是模型不够大。


干预效果:CPT>>加Epochs


Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本


10倍算力换来2%vs2倍算力换来12.5%。该把钱花在预训练,而不是无限堆SFT epoch。


物理溯源验证


将ILP样本中涉及的知识点在Dolma 5T语料库中检索:


  • 19.3%的知识点在Dolma中完全不存在→根因I(知识缺失)
  • 14.5%存在冲突信息→根因II(知识冲突)


消融与溯源结果:


Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本


CPT前后各模型准确率对比——提升在跨模型规模和领域中保持稳定


模型家族对比:


Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本


应用各项优化策略后各基线模型的性能提升对比


项目价值


学术价值


  • 首次系统性定义和量化SFT中的不完全学习现象
  • 提出了可复现的诊断框架(Detect→Attribute→Intervene→Verify)
  • 揭示了SFT的物理上限:它只能重组已有知识,无法创造新知识


实践指导意义


  • 不要迷信loss收敛。训练完了不等于学会了,需要pass@k+MC转换做样本级诊断。
  • 加epoch性价比极低。10倍SFT算力换2%改善,不如把预算投到预训练数据上。
  • 知识缺失是第一大根因。如果你的下游任务有大量模型没见过的新知识,SFT几乎无能为力——要先做CPT。
  • 数据去重和一致性是低成本高收益的事。全局shuffle和动态分桶实现简单,ROUGE-L能提升29%。
  • 2×2矩阵可在几分钟内完成根因定位。不需要全量重训,用early/late checkpoint对比即可。


作者团队


腾讯混元大模型团队(Tencent Hunyuan Team)&新南威尔士大学(UNSW),14位作者。研究方向涵盖LLM推理增强、奖励建模、模型效率优化等。


该工作入选ACL 2026主会Long Paper,是SFT诊断方向第一篇系统性研究。


论文(arXiv):https://arxiv.org/abs/2604.10079

论文(ACL Anthology):https://aclanthology.org/2026.acl-long.1393/

代码(GitHub):https://github.com/xccc-8071/why-supervised-fine-tuning-fails-to-learn


文章来自于微信公众号 “量子位”,作者 “量子位”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner