目录

基础大模型训练方法论综述-2025-2026

目录

2025-2026年基础大模型训练方法论综述:从DeepSeek V4到Kimi K2.5

一、引言

2025至2026年是基础大模型竞争格局发生结构性变化的两年。如果说2024年的主题是"MoE崛起与开源追赶",那么2025-2026年的主题就是"架构创新加速分化、后训练范式剧变、Agent能力成为核心竞争维度"。

国际格局方面,Anthropic的Claude系列持续占据榜首,Claude Opus 4.8以绝对优势位居LMArena第一;OpenAI的GPT系列仍具强大竞争力;Google的Gemini系列在多模态方向持续发力。头部闭源模型的能力天花板仍在快速抬升。

国内格局方面,竞争烈度远超预期。DeepSeek V4以CSA/HCA双注意力机制和OPD在线策略蒸馏开创了"蒸馏替代RL"的新范式;Qwen 3以极简RL(3995条query、170步即大幅提升数学推理)刷新了训练效率的认知;Kimi K2/K2.5在Agent能力训练上建立了独特壁垒;GLM-5在国产芯片适配和异步Agent RL基础设施上做出差异化探索;MiniMax M3的MSA稀疏注意力实现了28.4倍注意力计算减少;混元TurboS大胆采用Mamba-Transformer混合架构;Step 3.5 Flash和MiMo-V2-Flash则在小模型赛道各有独到之处。

LMArena最新排名(截至2026年6月):Claude Opus 4.8位列第一,GPT系列紧随其后,Qwen 3.7位列第五,国产模型整体进入全球第一梯队。这一排名反映了两个趋势:一是闭源头部模型仍有能力溢价,二是国产开源模型已与国际顶尖闭源模型形成真正竞争。

本文覆盖模型清单:DeepSeek V4 Pro/Flash、Qwen 3、Kimi K2、Kimi K2.5、GLM-5、MiniMax M3、混元TurboS、Step 3.5 Flash、MiMo-V2-Flash,共9个模型系列。

技术资料来源:以上模型的官方技术报告(Technical Report)和arXiv论文,资料详尽程度参差不齐——DeepSeek V4、GLM-5、Qwen 3的技术报告最为详尽,MiniMax M3和Step 3.5 Flash次之,混元TurboS和MiMo-V2-Flash的报告信息密度适中,Kimi K2/K2.5的报告在Agent训练方面信息最为丰富。


二、模型概览

2.1 模型总览表

模型总参数/激活参数架构类型层数专家配置训练数据量注意力机制关键创新资料详尽度
DeepSeek V4 Pro1.6T/49BMoE61384路由+1共享, Top-633TCSA+HCAmHC流形约束、OPD蒸馏替代RL、FP4量化感知训练★★★★★
DeepSeek V4 Flash284B/13BMoE43256路由+1共享, Top-632TCSA+HCA同V4 Pro的架构创新,小模型版本★★★★★
Qwen 3235B/22BMoE128路由, Top-836TQK-Norm极简RL、思考模式融合、强到弱蒸馏★★★★☆
Kimi K21.04T/32.6BMoE61384路由+1共享, Top-815.5TMLAMuonClip零spike、Agent数据合成流水线★★★★☆
Kimi K2.5基于K2MoE+视觉同K2MLA视觉Agent、Agent Swarm/PARL、Toggle启发式★★★★☆
GLM-5744B/40BMoE80256路由, MLA-25628.5TDSAIcePop、异步Agent RL(Slime)、国产芯片适配★★★★★
MiniMax M3428B/23BMoE60128路由+1共享, Top-4MSA28.4倍注意力计算减少、原生多模态★★★★☆
混元TurboS560B/56BMamba-Transformer混合128MoE16TGQA(仅7层)Mamba2线性复杂度、自适应CoT★★★☆☆
Step 3.5 Flash196B/11BMoE45289(288路由+1共享), Top-817.2TMFA+SWA混合AFD解耦并行、MIS-PO过滤式RL★★★★☆
MiMo-V2-Flash309B/15BMoE48256路由, Top-827TSWA+GA混合MOPD多教师蒸馏、R3路由一致性、MTP推测解码★★★★☆

2.2 关键观察

从总览表可以提炼出几个核心信号:

  1. MoE成为压倒性共识:9个模型系列中,除混元TurboS采用Mamba-Transformer混合架构外,其余8个全部采用MoE。Dense架构在新一代旗舰模型中已完全消失。
  2. 参数膨胀与激活参数克制并行:总参数从196B到1.6T跨度巨大,但激活参数普遍控制在11B-56B之间,反映了"大容量、低推理成本"的一致追求。
  3. 训练数据规模达到15T-36T量级:Qwen 3以36T token领先,DeepSeek V4紧随其后达33T,数据规模的竞争已进入"数十万亿token"时代。
  4. 每个模型都有独特的注意力机制创新:从CSA/HCA到MSA、DSA、MFA,注意力机制的创新是本轮竞争中分化最明显的技术维度。

三、预训练

3.1 架构演进

3.1.1 MoE已成绝对主流

在本文覆盖的9个模型系列中,8个采用MoE架构,这一比例相较2024年(DeepSeek V3、Qwen 2.5 MoE等少数模型领先尝试)已发生质变。MoE的核心优势在于:以较小的激活参数量(11B-56B)撬动巨大的总参数容量(196B-1.6T),从而在推理成本和模型能力之间取得最优平衡。

值得关注的细节差异:

模型总专家数共享专家激活专家数特殊设计
DeepSeek V4 Pro384路由1共享Top-6
DeepSeek V4 Flash256路由1共享Top-6
Qwen 3128路由Top-8移除共享专家
Kimi K2384路由1共享Top-8首层Dense,其余60层MoE
GLM-5256路由MLA-256+Muon Split
MiniMax M3128路由1共享Top-4
Step 3.5 Flash288路由1共享Top-83层Dense+42层MoE
MiMo-V2-Flash256路由Top-8无共享专家

一个有趣的分化点是共享专家的去留:Qwen 3和MiMo-V2-Flash选择移除共享专家,理由是增大路由专家数量比保留少量共享专家更有效;而DeepSeek V4、Kimi K2、MiniMax M3、Step 3.5 Flash则保留了1个共享专家。这一设计选择目前没有定论。

混元TurboS的异类路线值得特别讨论。它采用128层的Mamba-Transformer混合架构:57层Mamba2 + 7层Attention + 64层FFN/MoE,以AMF(Attention-Mamba-FFN)和MF(Mamba-FFN)交错块组成。在整个128层中,注意力层仅7层,占比5.5%。这一激进设计的核心赌注是Mamba2的O(n)线性复杂度能在长序列场景中获得本质性的效率优势,代价是需要用极少的注意力层来弥补Mamba在精确位置检索方面的不足。从LMSYS Arena第7名1356分的成绩看,这一架构选择是可行的,但是否优于纯Transformer+MoE仍需更多证据。

3.1.2 注意力机制创新:百花齐放

本轮模型竞争中,注意力机制的创新是最精彩的技术维度。各家从不同角度出发,提出了各自独特的稀疏注意力方案。

DeepSeek V4的CSA+HCA双机制

DeepSeek V4在MLA(Multi-head Latent Attention,DeepSeek V2首创)基础上提出了两种互补的注意力机制:

  • CSA(Compressed Sparse Attention,压缩稀疏注意力):每m=4个相邻token的KV对压缩为1个(通过可学习的线性层),然后用一个轻量级"闪电索引器"(Lightning Indexer)对压缩后的KV做top-k稀疏选择(V4 Pro的k=1024)。这意味着在1M上下文中,实际参与注意力计算的token数从百万级压缩到千级。
  • HCA(Hierarchical Compressed Attention,分层压缩注意力):压缩率更高(m’=128),但不做稀疏选择,而是对所有压缩后的KV做全dense注意力。这保证了全局信息的完整性。

CSA和HCA在Transformer层中交替使用,形成"局部精确选择+全局粗粒度覆盖"的互补格局。这一设计的推理效率优势极为显著:V4 Pro的KV缓存仅为V3的10%,FLOPs仅为V3.2的27%。

MiniMax M3的MSA(Mixed Sparse Attention)

MSA采用双分支设计:

  • 索引分支:轻量级选择器快速确定哪些KV块与当前查询相关
  • 主分支:对选中的KV块做精确的块稀疏注意力

具体参数:块大小128,每个查询选择16个块。在1M上下文下,注意力计算减少28.4倍,预填充加速9倍,解码加速15倍。配套的GPU内核优化包括:免指数Top-k(比torch.topk快2.5-5.1倍)和KV外循环内核。

GLM-5的DSA(Dynamic Sparse Attention)

DSA的独特之处在于极低的适配成本:仅需20B token的继续训练即可从全注意力迁移到稀疏注意力(对比DeepSeek V4从头训练的943.7B token代价)。DSA使用确定性top-k选择,避免了随机性带来的训练不稳定问题。

Step 3.5 Flash的MFA+SWA混合

Step 3.5 Flash采用混合滑动窗口注意力(SWA)和全局注意力,比例为3:1(每4层中3层SWA、1层全局)。SWA窗口大小为512 token。独特之处在于头级门控注意力——每个注意力头可以学习自己的门控权重来决定SWA和全局注意力的混合比例。

MiMo-V2-Flash的SWA+GA混合

MiMo-V2-Flash同样采用SWA和全局注意力混合,但比例更极端:5:1(48层中39层SWA、9层GA)。SWA窗口仅128 token——这是所有模型中最小的窗口。为防止极小窗口导致的注意力坍塌问题,MiMo引入了可学习的sink偏置:对特定位置(如BOS token)添加可学习的偏置项,使模型能把"垃圾注意力"分配到sink token上,避免注意力权重的退化。

混元TurboS的极端设计

128层中仅7层注意力(GQA,64 Query/8 KV头),其余全部由Mamba2和FFN/MoE组成。Mamba2采用d_state=128、chunk_size=128的参数配置,提供O(n)线性复杂度。这是所有模型中注意力层占比最低的设计。

注意力机制创新总结

模型方案名称核心思路压缩/稀疏倍率适配成本
DeepSeek V4CSA+HCA压缩+top-k选择 / 高压缩+denseKV cache仅V3的10%从头训练
MiniMax M3MSA索引+块稀疏双分支28.4倍注意力计算减少从头训练
GLM-5DSA确定性top-k仅20B token适配
Step 3.5 FlashMFA+SWA 3:1头级门控混合从头训练
MiMo-V2-FlashSWA+GA 5:1极小窗口+sink偏置从头训练
混元TurboSMamba2+GQA线性复杂度+极少注意力O(n)线性从头训练

3.1.3 mHC流形约束超连接

DeepSeek V4引入的**mHC(manifold-constrained Hyper-Connection)**是对残差连接的根本性重新设计。传统残差连接(y = x + f(x))的问题在于:随着层数加深,各层对最终输出的贡献梯度可能出现不平衡。

mHC的核心思想:

  1. 将残差连接替换为一个双随机矩阵(每行每列之和均为1),用于控制各层输入/输出的混合权重
  2. 双随机矩阵的约束通过Sinkhorn-Knopp算法(20次迭代)实现——对一个可学习的矩阵交替进行行归一化和列归一化,使其收敛到双随机矩阵流形上
  3. 矩阵参数是动态参数化的(而非固定值),可以随训练自适应调整

这一设计的精妙之处在于:双随机矩阵保证了信息流的"守恒性"——不会出现某些层的贡献被过度放大或抑制的情况。实测显示,mHC仅增加6.7%的额外计算时间,但对深层网络的训练稳定性和性能有显著提升。

3.1.4 MTP(Multi-Token Prediction)

MTP在本轮模型中得到广泛采用:

  • GLM-5:MTP 3层共享,推理时的平均接受长度为2.76
  • Step 3.5 Flash:MTP-3头,引入Fast-MTP位置感知损失——让每个预测头根据其预测位置(第1、2、3个未来token)使用不同的损失权重
  • MiMo-V2-Flash:MTP推测解码达到3.6的接受长度,实现2.6倍推理加速

MTP的价值是双重的:训练时提供更丰富的梯度信号(每个位置预测多个未来token),推理时通过推测解码(speculative decoding)显著提升吞吐量。

3.1.5 AFD注意力-FFN解耦并行

Step 3.5 Flash提出的**AFD(Attention-FFN Decoupling)**是一个工程导向的架构创新。传统Transformer的注意力层和FFN层是串行执行的(先注意力、再FFN)。AFD将二者解耦为并行执行:注意力和FFN同时计算,结果在层输出时合并。这减少了每层的串行延迟,在推理时可以更好地利用GPU并行计算能力。

3.2 数据工程

3.2.1 数据规模对比

模型预训练数据量语言覆盖备注
Qwen 336T token119种语言本轮最大数据量
DeepSeek V4 Pro33T token
DeepSeek V4 Flash32T token
GLM-528.5T token五阶段训练
MiMo-V2-Flash27T token三阶段训练
Step 3.5 Flash17.2T token
混元TurboS16T token
Kimi K215.5T token两阶段训练

数据规模的竞争已进入"数十万亿token"时代。值得注意的是,更大的数据量并不直接等于更好的模型:DeepSeek V4以33T token的数据量在多项基准上超越了使用36T token的Qwen 3,说明数据质量和训练策略的重要性不亚于数据规模。

3.2.2 合成数据的规模化使用

合成数据已从"辅助补充"变为"核心组成部分"。最典型的案例:

  • Kimi K2的知识改写策略:将原始网页文本通过大模型改写为更结构化、更适合训练的格式,这一策略在预训练阶段就大规模使用
  • Kimi K2的Agent数据合成流水线:从3000+个GitHub MCP(Model Context Protocol)工具出发,合成20000+工具定义,再生成多轮Agent交互轨迹。这是目前公开信息中规模最大的Agent训练数据合成方案
  • Qwen 3的推理增强阶段:在36T总数据中专门划出5T用于推理增强,其中包含大量合成的数学和代码推理数据

3.2.3 数据改写策略

Kimi K2在数据工程上的一个显著特点是知识改写(Knowledge Rewriting)。其核心思路是:互联网上的原始文本往往充斥着广告、导航栏、无关链接等噪声,直接用于训练效率不高。Kimi K2使用已训练好的模型对这些文本进行"改写"——保留核心知识内容,但重新组织为更适合语言模型学习的格式。这一策略的成本(改写所需的推理算力)与收益(训练效率提升)之间的权衡,是一个值得深入研究的问题。

3.3 训练策略

3.3.1 长上下文训练

长上下文能力已成为标配需求,各模型普遍采用多阶段上下文扩展策略:

模型扩展路径最终上下文长度
DeepSeek V44K → 1M(多阶段)1M
Qwen 3三阶段(通用30T→推理增强5T→长上下文)
Kimi K2两阶段预训练 + 退火400B + 长上下文60B
GLM-5五阶段预训练
MiniMax M31M
混元TurboS长上下文两阶段扩展256K
MiMo-V2-Flash三阶段(通用22T→代码增强4T→长上下文1T)

共同的模式是:先在短序列上充分训练基础能力,再通过专门的长上下文阶段逐步扩展。这种策略的原因在于:长序列训练的计算成本远高于短序列(自注意力的二次复杂度),因此在早期用短序列建立基础能力更为经济。

3.3.2 FP8/FP4混合精度

低精度训练在本轮模型中进一步深化:

  • DeepSeek V4:首次引入FP4量化感知训练,将MoE专家权重和CSA索引器的QK路径降到FP4精度。这是业界首次在预训练阶段就使用FP4的报告,不同于推理时的量化——训练时就用低精度意味着模型从一开始就适应了量化误差
  • 其他模型:FP8混合精度已是普遍实践,不再单独作为技术亮点报告

3.3.3 训练稳定性

训练稳定性是大规模预训练的核心工程挑战。本轮模型在这一维度上的创新尤为突出:

Kimi K2的MuonClip——零loss spike

MuonClip是在Muon优化器基础上增加的稳定性约束:对注意力层的QK内积设置阈值τ=100,超过阈值时进行裁剪。这一简单而优雅的设计使得Kimi K2在整个15.5T token的预训练过程中实现了零loss spike——这是一个里程碑式的成果。对比之下,大部分大规模训练都会经历数次到数十次的loss spike,每次spike都意味着训练状态的退化和恢复时间的浪费。

DeepSeek V4的预见性路由+SwiGLU钳制

DeepSeek V4采用双重稳定性保障:

  1. 预见性路由(Foresight Routing):解耦MoE路由器的更新和模型骨干的更新。正常训练时,路由器和骨干同步更新;当检测到潜在的loss spike信号时,路由器的更新暂停(冻结),仅更新骨干。这增加约20%的计算开销,但由于仅在spike风险时激活,实际平均开销远低于20%
  2. SwiGLU钳制:将SwiGLU激活函数的输出钳制在[-10, 10]范围内,防止极端激活值传播

Step 3.5 Flash的Polar Express

Step 3.5 Flash在Muon优化器的精度上做了专门优化(称为Polar Express),在17.2T token的训练中仅发生1次loss spike。

稳定性技术对比总结

模型稳定性方案Loss spike次数额外开销
Kimi K2MuonClip (QK-Clip τ=100)0极低
Step 3.5 FlashPolar Express1
DeepSeek V4预见性路由+SwiGLU钳制约20%(峰值)

3.3.4 优化器:Muon取代AdamW

Muon优化器的采用是本轮模型的一个显著趋势:

模型优化器特殊配置
DeepSeek V4Muon10次Newton-Schulz迭代(前8步快速+后2步精确),混合桶分配
Kimi K2MuonClipMuon+QK-Clip稳定性约束
GLM-5Muon SplitMLA-256头部分割
Step 3.5 FlashMuon+Polar Express精度优化

Muon的核心优势在于:它不依赖于动量的一阶/二阶估计(AdamW的核心),而是通过Newton-Schulz迭代对梯度矩阵进行正交化处理,理论上能更好地利用梯度的几何结构。DeepSeek V4的实现细节尤为精巧:前8步Newton-Schulz迭代用快速但精度较低的方式加速收敛,后2步切换到高精度模式确保最终正交化质量;混合桶分配则根据参数矩阵的大小将其分配到不同的计算桶中,优化并行效率。

3.4 训练基础设施与成本

3.4.1 GPU规模与成本对比

模型GPU规模备注
Step 3.5 Flash4096卡H800明确公开
其他模型未明确公开推测在2000-16000卡量级

GPU规模和训练成本是多数技术报告中最不透明的部分。仅Step 3.5 Flash明确公开了4096卡H800的训练规模。但从训练数据量和模型规模推断,DeepSeek V4 Pro(1.6T参数、33T token)的训练规模很可能超过10000卡。

3.4.2 通信优化

大规模MoE训练的核心通信瓶颈在于专家之间的All-to-All通信。各模型采用不同策略应对:

  • DeepSeek V4的混合桶分配和专家并行优化是其训练效率的重要来源
  • GLM-5在国产芯片(7个硬件平台)上的适配工作,面临的通信挑战更为复杂——不同芯片的互联拓扑和通信带宽差异巨大,需要针对每个平台单独优化通信策略
  • MiMo-V2-Flash的R3(Rollout Routing Replay)技术间接解决了MoE训练中的一个通信相关问题:RL阶段rollout生成和训练更新使用不同的模型版本,导致路由决策不一致。R3通过在训练时重放rollout阶段的路由决策来消除这一不一致性

四、后训练

4.1 SFT策略

4.1.1 思考模式设计对比

“思考模式”——即模型在生成最终回答前先进行内部推理——已成为2025-2026年模型的标配功能。但各家的设计理念存在明显差异:

Qwen 3的/think和/no_think

Qwen 3采用最简洁的二元设计:用户通过在提示中添加/think/no_think标记来控制模型是否进行内部推理。这一设计的实现依赖于后训练中的"思考模式融合"阶段——将带思考和不带思考的训练数据混合训练,使同一个模型能够根据指令切换模式。

Qwen 3的一个重要发现是:思考预算是自然涌现的能力——模型在RL训练后,会自动学会根据问题难度分配不同长度的思考过程,无需显式的长度控制机制。

DeepSeek V4的三种推理力度

DeepSeek V4提供了更精细的梯度控制:

  • Non-think:不进行内部推理,直接生成回答(适合简单问题)
  • Think High:标准深度的内部推理
  • Think Max:最大深度的内部推理(适合极难的数学/编程问题)

三种力度通过不同的系统提示触发,模型在OPD蒸馏阶段学会了区分这三种模式。

GLM-5的三种模式

GLM-5同样提供三种推理模式,但其设计理念更偏向于"场景适配"而非"力度梯度"——针对不同的任务类型(如数学推理、代码生成、通用对话)提供不同的思考策略。

混元TurboS的自适应CoT

混元TurboS的设计最为激进:自适应长短CoT——模型根据问题难度自动决定使用长链思考还是短链思考,无需用户手动切换。实测显示,这一策略使混元TurboS仅使用DeepSeek-R1 52.8%的token量即可达到可比的推理性能。这意味着在保持性能的同时,推理成本近乎减半。

思考模式对比总结

模型模式数控制方式独特之处
Qwen 32/think /no_think标记思考预算自然涌现
DeepSeek V43Non-think/Think High/Think Max三级力度梯度
GLM-53场景适配
混元TurboS自适应无需手动切换仅R1的52.8% token量

4.1.2 多轮审议学习

混元TurboS提出的**多轮审议学习(Multi-round Deliberative Learning)**是一种独特的SFT策略,分三步:

  1. 评判阶段:让模型对自己的回答进行自我评判,识别弱点
  2. 弱点审议:针对识别出的弱点,让模型生成改进后的回答
  3. 迭代SFT:将原始回答-评判-改进三元组作为训练数据,迭代进行SFT

这一策略的本质是让模型从自己的错误中学习——类似于人类学习中的"错题本"方法。

4.2 强化学习

4.2.1 GRPO仍是主流算法

GRPO(Group Relative Policy Optimization,DeepSeek首创)在本轮模型中仍然是最广泛采用的RL算法。混元TurboS明确报告使用两阶段GRPO:推理阶段30万条数据 + 通用阶段16万条数据。

但更值得关注的是各家在GRPO基础上的改进和替代方案。

4.2.2 DeepSeek V4的OPD——蒸馏完全替代RL

**OPD(Online Policy Distillation,在线策略蒸馏)**是DeepSeek V4在后训练范式上的重大创新,其核心思想是:用蒸馏完全替代传统RL

OPD的工作流程:

  1. 领域专家独立训练:为不同领域(数学、代码、通用等)分别训练专家模型,每个专家模型走完整的SFT+GRPO流程
  2. 在线策略蒸馏合并:不做简单的模型合并(如参数平均),而是用反向KL散度对全词表的logit分布进行蒸馏——学生模型(最终的V4)在自己的策略分布下生成样本,然后匹配10+个教师模型的logit分布

这一设计的深层逻辑是:传统RL的奖励信号是标量的(一个数字衡量回答好坏),而蒸馏的"奖励信号"是整个词表的概率分布——信息量大了几个数量级。这解释了为什么OPD能用更少的训练步数达到更好的效果。

更精妙的是,DeepSeek V4还引入了生成式奖励模型(GRM):传统的奖励模型是判别式的(输入一个回答,输出一个分数),GRM则是生成式的(生成评价文本,再从评价中提取分数)。并且,DeepSeek V4对GRM本身也做RL优化——用RL来提升奖励模型的判断质量,形成一个嵌套的优化循环。

4.2.3 Qwen 3的极简RL

Qwen 3的RL结果堪称本轮最令人惊讶的发现之一:

  • 仅使用3995条query(不到4000条问题)
  • 仅训练170步GRPO
  • AIME数学竞赛基准从70.1分提升到85.1分(+15分)

这一结果挑战了"RL需要大量数据和长时间训练"的普遍认知。Qwen 3团队的解释是:如果预训练和SFT已经建立了足够强的基础能力,RL的作用更多是"激活"而非"教授"——少量高质量的RL信号就足以触发模型已有但未充分释放的推理能力。

Qwen 3的后训练遵循四阶段流程:

  1. 长CoT冷启动:用长链思考数据做SFT,建立思考习惯
  2. 推理RL:上述的极简GRPO(3995条query、170步)
  3. 思考模式融合:混合/think和/no_think训练数据
  4. 通用RL:在更广泛的任务上做RL

4.2.4 GLM-5的IcePop

IcePop是GLM-5针对RL中一个被长期忽视问题的解决方案:训练-推理分布不匹配

问题的本质是:RL训练时,模型从自己的分布中采样(on-policy),但训练使用的奖励模型是在另一个分布上训练的(off-policy评估)。随着RL训练的进行,模型的分布与奖励模型的训练分布之间的差异越来越大,导致奖励信号变得不可靠。

IcePop的解决方案:

  1. 显式建模分布不匹配:量化当前策略与奖励模型训练分布之间的差异
  2. Pop算子裁剪:当差异超过阈值时,裁剪奖励信号的影响
  3. 移除KL正则化:传统RL使用KL散度正则化来限制策略更新幅度,IcePop认为这反而阻碍了有效探索,直接移除

4.2.5 Step 3.5 Flash的MIS-PO

MIS-PO(Multi-level Importance Sampling Policy Optimization,多层级重要性采样策略优化)是Step 3.5 Flash提出的离散过滤式RL方法。其核心创新是双层级过滤

  1. 轨迹层级过滤:在完整回答层面,根据奖励信号过滤掉质量过低的轨迹
  2. Token层级过滤:在token层面,根据重要性采样权重进一步过滤掉异常token

这种双层级过滤的好处是:避免了少数异常token或低质量轨迹对策略更新的过度影响,使RL训练更加稳定。

4.2.6 混元TurboS的两阶段GRPO

混元TurboS采用标准的两阶段GRPO:

  • 推理阶段:30万条推理相关数据(数学、代码、逻辑推理)
  • 通用阶段:16万条通用任务数据

这一设计反映了"先推理、后通用"的后训练范式——先在推理任务上建立强大的思考能力,再通过通用阶段确保不丧失通用对话能力。

4.3 蒸馏

蒸馏(Distillation)在本轮模型中的地位发生了质变——从"可选的效率优化手段"升级为"核心的训练范式"。

4.3.1 MiMo-V2-Flash的MOPD(多教师在线蒸馏)

**MOPD(Multi-teacher Online Policy Distillation)**是MiMo-V2-Flash的后训练核心方法。与DeepSeek V4的OPD相比,MOPD有几个独特之处:

  1. 多教师架构:不同领域使用不同的专家教师模型,每个教师在自己的领域提供最高质量的指导
  2. Token级奖励信号:传统RL的奖励是轨迹级的(一个完整回答一个分数),MOPD将教师模型的token级logit作为奖励信号,信息粒度细了1-2个数量级
  3. 反向KL+裁剪重要性采样+ORM结果奖励:三种信号的混合——反向KL蒸馏提供分布匹配信号,裁剪重要性采样防止分布偏移过大,ORM(Outcome Reward Model)结果奖励提供最终答案正确性的监督

MOPD的一个关键工程挑战是:MoE模型在RL训练中,rollout生成和参数更新使用不同版本的模型,导致MoE路由决策不一致。MiMo-V2-Flash通过**R3(Rollout Routing Replay)**技术解决这一问题:在参数更新阶段重放rollout阶段的路由决策,确保训练信号的一致性。

4.3.2 Qwen 3的强到弱蒸馏

Qwen 3在小模型训练上采用了极为高效的策略:用大模型(235B)的logit分布作为教师信号,蒸馏训练小模型。关键数据:仅需大模型1/10的GPU训练时间即可获得接近大模型水平的小模型。

这一结果的实际意义是深远的:它表明在拥有强大教师模型的前提下,训练同系列小模型的边际成本极低。这解释了为什么Qwen 3能够同时发布Dense和MoE两条产品线的多种规模模型。

4.3.3 DeepSeek V4的OPD

如4.2.2节所述,OPD的核心是反向KL全词表logit蒸馏,使用10+教师模型。在蒸馏的语境下,OPD的独特之处在于"在线"——学生模型在自己的分布下生成样本(而非使用教师生成的样本),这避免了传统离线蒸馏中的分布偏移问题。

4.3.4 GLM-5的跨阶段蒸馏

GLM-5在多阶段后训练中引入了跨阶段蒸馏防遗忘机制。问题的背景是:后训练通常分多个阶段(SFT→RL→对齐等),后一阶段的训练可能导致前一阶段建立的能力退化(灾难性遗忘)。GLM-5的解决方案是在每个阶段都保留前一阶段的模型作为"教师",通过蒸馏信号约束当前阶段的训练不过度偏离前一阶段的知识。

4.3.5 蒸馏技术对比

模型蒸馏方法教师来源蒸馏粒度核心价值
DeepSeek V4OPD10+领域专家全词表logit替代RL
MiMo-V2-FlashMOPD多领域教师Token级logit+ORM多信号融合
Qwen 3强到弱蒸馏235B大模型Logit1/10 GPU训练小模型
GLM-5跨阶段蒸馏前阶段模型防灾难性遗忘

4.4 Agent能力训练

Agent能力(即模型使用工具、与环境交互、完成复杂多步骤任务的能力)在本轮模型中从"附加功能"上升为"核心竞争维度"。Kimi K2/K2.5在这一方向上投入最深。

4.4.1 Kimi K2的大规模Agent数据合成流水线

Kimi K2构建了目前公开信息中最完整的Agent训练数据合成管线:

  1. 工具收集:从3000+个GitHub MCP工具库中提取真实工具定义
  2. 工具扩展:基于真实工具,合成生成20000+工具定义——通过变换参数、组合功能、模拟新工具来扩大覆盖面
  3. 轨迹生成:使用已有的强模型,在合成工具上生成多轮交互轨迹——包括工具调用、结果解析、错误处理、多步推理等复杂场景
  4. 质量过滤:对生成的轨迹进行多维度质量过滤,保留高质量训练数据

这一流水线的关键洞察是:Agent能力的训练瓶颈不在于算法(GRPO等RL算法已足够成熟),而在于数据——高质量的Agent交互数据极度稀缺,必须通过合成方式大规模制造。

4.4.2 Kimi K2.5的Agent Swarm与PARL框架

Kimi K2.5在K2的基础上进一步推进Agent能力,引入了两个关键创新:

Agent Swarm架构

Agent Swarm是一种多Agent协作架构:

  • 编排器(Orchestrator):负责任务分解和子Agent调度
  • 子Agent:各自专注于特定领域的工具使用(如代码执行、文件操作、搜索等)
  • 解耦设计:编排器可训练,子Agent冻结

这一架构的关键优势是:编排器的训练不需要同时训练所有子Agent,大幅降低了训练复杂度。同时,新的子Agent可以即插即用,无需重新训练编排器。

PARL(Parallel Agent Reinforcement Learning)框架

PARL解决了Agent RL训练中的效率问题:传统的Agent RL需要串行执行工具调用和环境交互,导致GPU利用率极低(大量时间等待环境返回结果)。PARL通过并行化多个Agent的rollout过程,将等待时间与计算时间重叠,显著提升训练吞吐量。

实测效果:延迟降低3-4.5倍。

Toggle启发式

Kimi K2.5还提出了Toggle启发式策略:在推理时,根据任务特征动态决定是否启用思考模式。这一策略实现了25-30%的token缩减,且性能几乎无损。

视觉Agent能力

Kimi K2.5的视觉能力基于MoonViT-3D视觉编码器:采用4帧时空体处理(将连续4帧图像/视频帧作为一个3D输入处理),实现4倍时间维度压缩。一个令人惊讶的发现是零样本视觉SFT:仅用文本数据做SFT即可激活视觉推理能力,无需视觉标注数据。这表明在预训练阶段建立的跨模态表示已足够强大。

进一步的跨模态RL增强实验显示:视觉RL不仅提升视觉任务性能,还能反向提升纯文本任务——MMLU-Pro +1.7,GPQA +2.1。这暗示了跨模态训练信号的潜在正迁移效应。

4.4.3 GLM-5的异步Agent RL基础设施(Slime)

GLM-5为Agent RL训练构建了名为Slime的专用基础设施:

  • 1000+并发rollout:同时运行1000多个Agent与环境的交互
  • TITO网关:Token-In-Token-Out网关,管理Agent与环境之间的通信
  • DP感知路由:根据数据并行(Data Parallelism)拓扑优化请求路由

Slime解决的核心问题是Agent RL的训练效率:由于Agent需要与真实或模拟环境交互,每一步都有IO延迟,传统的同步RL在Agent场景下GPU利用率极低。Slime通过异步设计和大规模并发将GPU利用率提升到可接受水平。

4.4.4 MiniMax M2的Forge RL系统

虽然MiniMax M3的技术报告主要聚焦于架构创新,但其前序版本M2中开发的Forge RL系统为Agent RL训练提供了工程参考。Forge是一个通用的RL训练平台,支持多种奖励信号和训练算法的灵活组合。


五、推理效率

推理效率直接决定了模型的部署成本和用户体验。本轮模型在这一维度上的创新可从以下几个方面展开:

5.1 DeepSeek V4的KV缓存压缩

DeepSeek V4的CSA+HCA双注意力机制带来的推理效率提升是全面的:

  • KV缓存:仅为V3的10%。在1M上下文场景下,这意味着显存需求从数百GB级压缩到数十GB级
  • FLOPs:V4 Pro仅为V3.2的27%
  • 这使得V4在保持甚至超越V3性能的同时,推理成本大幅下降

5.2 MSA的注意力计算减少

MiniMax M3的MSA在1M上下文下实现:

  • 注意力计算减少28.4倍
  • 预填充加速9倍
  • 解码加速15倍

配套GPU内核的实现也值得关注:

  • 免指数Top-k:传统的torch.topk需要对所有元素计算指数和排序,MiniMax设计的免指数Top-k算法绕过了指数计算,速度是torch.topk的2.5-5.1倍
  • KV外循环内核:将KV作为外循环(而非传统的Query外循环),更好地利用GPU的内存访问模式

5.3 MTP推测解码

MTP在推理时的价值主要体现为推测解码加速:

模型MTP头数平均接受长度加速比
MiMo-V2-Flash多头3.62.6倍
GLM-53头共享2.76
Step 3.5 Flash3头

MiMo-V2-Flash的3.6平均接受长度意味着:模型每次推测性生成约3.6个token中,平均3.6个都能被接受(与自回归生成结果一致),从而实现2.6倍的推理吞吐量提升。这一数字在当前公开报告中属于最优水平。

5.4 混元TurboS的Mamba线性复杂度

混元TurboS的Mamba2层提供O(n)线性复杂度,理论上在长序列场景下具有本质性优势:当序列长度从4K增长到256K时,Transformer的注意力计算量增长约4096倍(二次),而Mamba仅增长64倍(线性)。但需要注意的是,混元TurboS仍保留了7层注意力(GQA),因此其整体复杂度并非严格线性。

5.5 推理效率总结

模型核心优化手段关键指标
DeepSeek V4CSA+HCA压缩KV cache仅V3的10%,FLOPs仅V3.2的27%
MiniMax M3MSA稀疏注意力28.4倍注意力计算减少
MiMo-V2-FlashMTP推测解码2.6倍加速
混元TurboSMamba2线性复杂度O(n)理论优势
Step 3.5 FlashAFD并行+MTP减少串行延迟

六、关键技术创新横向对比

以下从架构、注意力、优化器、数据、后训练、推理效率六个维度对9个模型进行全面横向对比:

维度DeepSeek V4 ProDeepSeek V4 FlashQwen 3Kimi K2Kimi K2.5GLM-5MiniMax M3混元TurboSStep 3.5 FlashMiMo-V2-Flash
总参/激活参1.6T/49B284B/13B235B/22B1.04T/32.6B基于K2744B/40B428B/23B560B/56B196B/11B309B/15B
架构MoEMoEMoEMoEMoE+视觉MoEMoEMamba-TF混合MoEMoE
注意力CSA+HCACSA+HCAQK-NormMLAMLADSAMSAGQA(7层)MFA+SWA 3:1SWA+GA 5:1
优化器MuonMuonMuonClipMuon SplitMuon+Polar
残差连接mHC流形约束mHC流形约束标准标准标准标准标准标准标准标准
MTP3头共享3头多头
数据量33T32T36T15.5T28.5T16T17.2T27T
训练稳定性预见性路由+SwiGLU同ProMuonClip零spikePolar Express(1 spike)
后训练核心OPD蒸馏替代RLOPD极简RL(3995q/170步)Agent数据合成PARL+SwarmIcePop+异步Agent RL自适应CoT+审议学习MIS-POMOPD多教师蒸馏
思考模式三级力度三级力度/think /no_thinkToggle启发式三种模式自适应CoT
蒸馏OPD全词表logitOPD强到弱(1/10 GPU)跨阶段防遗忘MOPD token级奖励
Agent训练3000+MCP→20000+工具Agent Swarm/PARLSlime异步RLForge RL
推理优化KV cache为V3的10%同Pro25-30% token缩减接受长度2.7628.4倍注意力减少O(n)线性AFD并行2.6倍MTP加速
代表性基准SWE-bench 80.6%AA Intelligence v4首个50分开源LMSYS #7 1356分SWE-bench 73.4%

七、趋势与启示

7.1 六个确定性趋势

趋势一:MoE成为唯一架构选择

9个模型中8个采用MoE,唯一的例外(混元TurboS的Mamba-Transformer混合)本身也包含MoE专家层。Dense架构在旗舰模型中已完全退出舞台。

MoE的胜出逻辑是清晰的:在推理成本受限的条件下(API定价压力、端侧部署需求),MoE以较小的激活参数(11B-56B)提供与Dense大模型(数百B激活参数)可比的能力。当DeepSeek V4以49B激活参数达到1.6T总参数的表现时,任何团队都很难justify训练一个1.6T的Dense模型。

这一趋势的一个重要推论是:MoE的工程能力(路由稳定性、专家负载均衡、All-to-All通信优化)正在成为大模型团队的核心竞争力

趋势二:稀疏注意力百花齐放

CSA/HCA、MSA、DSA、MFA、SWA+GA——每个主要模型都提出了自己独特的稀疏注意力方案。这一现象说明:标准的全注意力机制在长上下文场景下的效率瓶颈已是共识,但最优的替代方案尚未收敛。

各方案的设计哲学存在本质差异:

  • 压缩派(CSA/HCA):先压缩KV,再选择或全用
  • 选择派(MSA、DSA):不压缩,直接选择最相关的KV
  • 窗口派(SWA+GA、MFA):用滑动窗口覆盖局部,用少量全局层覆盖远程
  • 线性派(Mamba2):用状态空间模型彻底替代注意力

这些方案各有优劣,短期内不太可能统一到一种范式。

趋势三:Muon优化器取代AdamW

DeepSeek V4、Kimi K2、GLM-5、Step 3.5 Flash——4个模型明确采用Muon或其变体。AdamW在过去十年统治了深度学习优化器的版图,Muon是第一个在大规模预训练中证明了优越性的替代方案。

Muon的核心优势在于:通过Newton-Schulz迭代对梯度进行正交化处理,能更好地利用梯度的几何结构,尤其在大batch size训练中表现突出。各家在Muon基础上的定制化改进(MuonClip、Muon Split、Polar Express)表明,Muon的基础框架已被接受,竞争焦点转向了具体的实现优化。

趋势四:蒸馏正在替代传统RL

DeepSeek V4的OPD和MiMo-V2-Flash的MOPD代表了一个可能改变后训练范式的趋势:用蒸馏替代(或大幅减少)传统RL

这一趋势的底层逻辑:

  • RL的奖励信号是标量的(一个分数),信息密度低
  • 蒸馏的"奖励信号"是整个词表的概率分布,信息密度高几个数量级
  • RL的训练不稳定(奖励黑客、分布偏移等问题),蒸馏的训练更稳定
  • RL需要大量rollout计算,蒸馏的计算效率更高

但蒸馏有一个本质限制:它需要比学生更强的教师模型。当训练的是"最强模型"时,教师从何而来?DeepSeek V4的答案是"领域专家"——在特定领域训练到极致的专家模型,即使总能力不如最终模型,在各自领域也能提供有效的教师信号。

趋势五:思考模式成为标配

所有主要模型都支持某种形式的思考模式。差异在于控制方式:

  • 手动控制(Qwen 3的/think /no_think)
  • 多级控制(DeepSeek V4的三种力度)
  • 全自适应(混元TurboS)

这一趋势的本质是:用户对推理成本(token数量)和推理质量之间的权衡有不同需求。简单问题不需要长链思考(浪费token),复杂问题需要深度推理(否则质量不够)。思考模式的设计直接影响用户体验和API成本。

从技术实现角度看,Qwen 3发现的"思考预算自然涌现"是一个重要信号——经过充分训练的模型能自动学会分配思考资源,无需显式的长度控制机制。这暗示着未来思考模式可能趋向全自适应。

趋势六:Agent能力成为核心竞争维度

Kimi K2/K2.5的Agent数据合成流水线(3000+ MCP工具→20000+合成工具)、GLM-5的Slime异步Agent RL基础设施(1000+并发rollout)、MiniMax M2的Forge RL系统——多个团队在Agent训练上投入了大量工程资源。

Agent能力的重要性来自应用层面的需求拉动:大模型从"回答问题"向"完成任务"演进,需要使用工具(搜索、代码执行、API调用等)、与环境交互(浏览器、文件系统等)、处理多步骤任务(分解→执行→验证→修正)。这些能力无法通过单纯的语言建模获得,需要专门的训练方法和数据。

Kimi K2在SWE-bench等Agent基准上的强劲表现(以及Kimi K2.5将Agent能力扩展到视觉领域)验证了这一投入方向。DeepSeek V4在SWE-bench Verified上达到80.6%、Codeforces 3206分、LiveCodeBench 93.5%的成绩,同样体现了Agent/代码能力的竞争烈度。

7.2 开放问题

问题一:稀疏注意力会统一到一种范式吗?

当前的稀疏注意力方案至少有5种不同的设计哲学(压缩、选择、窗口、线性、混合)。它们是否会像MoE统一了模型架构那样,最终收敛到一种最优方案?

倾向于不会的论据:不同方案优化的目标不同——CSA/HCA优化KV缓存大小,MSA优化计算量,SWA优化实现简单性,Mamba优化理论复杂度。这些目标之间存在根本性的权衡。

倾向于会的论据:最终市场会选择综合效率最高的方案,就像Transformer统一了RNN/CNN/Attention的竞争一样。DeepSeek V4的CSA+HCA目前看来在"KV缓存压缩+计算效率"上取得了最好的综合平衡,有可能成为事实标准。

问题二:蒸馏能完全替代RL吗?

DeepSeek V4的OPD已经在实践中用蒸馏完全替代了传统RL。但这引发了一个根本性问题:如果最强模型的训练也依赖蒸馏,那么"教师"从何而来?

可能的答案:

  1. 领域专家路线(DeepSeek V4已在走):训练多个领域专家,每个在自己的领域达到极致,然后蒸馏合并。教师不需要在所有维度上都强于学生,只需在特定维度上提供有效信号
  2. 自蒸馏路线:模型用自己的历史版本作为教师,通过迭代自改进不断提升
  3. RL+蒸馏混合路线:RL用于探索能力边界(寻找教师模型没有的新知识),蒸馏用于高效传播已有知识

Qwen 3的极简RL结果(3995条query、170步)暗示了另一种可能:也许少量高质量的RL已经足够,蒸馏负责剩余的大部分工作。未来的后训练范式可能是"少量RL探索+大量蒸馏传播"的组合。

问题三:Mamba-Transformer混合是未来吗?

混元TurboS用128层中仅7层注意力(5.5%)证明了Mamba-Transformer混合架构的可行性,LMSYS Arena第7名1356分的成绩也说明其性能可与纯Transformer竞争。

但需要注意的几点事实:

  1. 混元TurboS是本文覆盖的9个模型中唯一采用Mamba-Transformer混合的——其他8个团队都选择了纯Transformer+MoE
  2. Mamba在精确位置检索(如"第327个token是什么")等任务上仍有理论局限,这也是混元TurboS保留7层注意力的原因
  3. Mamba的线性复杂度优势在短序列场景下不明显,只有在长序列(>64K)场景下才显现

Mamba-Transformer混合很可能是一个有价值的备选路线,尤其在长上下文和低延迟场景下。但它是否能取代纯Transformer+MoE成为主流,目前证据不足以下结论。


八、参考文献

  1. DeepSeek V4 Technical Report, DeepSeek, 2025.
  2. Qwen 3 Technical Report, Alibaba Qwen Team, 2025.
  3. Kimi K2 Technical Report, Moonshot AI, 2025.
  4. Kimi K2.5 Technical Report, Moonshot AI, 2025-2026.
  5. GLM-5 Technical Report, Zhipu AI, 2025.
  6. MiniMax M3 Technical Report, MiniMax, 2025.
  7. 混元TurboS Technical Report, Tencent Hunyuan, 2025.
  8. Step 3.5 Flash Technical Report, StepFun, 2025.
  9. MiMo-V2-Flash Technical Report, Xiaomi MiMo Team, 2025.
  10. DeepSeek V3: Mixture-of-Experts Language Model, DeepSeek, 2024. arXiv:2412.19437
  11. DeepSeek R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, DeepSeek, 2025. arXiv:2501.12948
  12. Qwen2.5 Technical Report, Alibaba Qwen Team, 2024. arXiv:2412.15115
  13. Muon: An optimizer for hidden layers in neural networks, Jordan et al., 2024.
  14. MLA: Multi-head Latent Attention, introduced in DeepSeek V2 Technical Report, 2024. arXiv:2405.04434
  15. Mamba: Linear-Time Sequence Modeling with Selective State Spaces, Gu and Dao, 2023. arXiv:2312.00752
  16. Mamba-2: The Structured State Space Duality, Dao and Gu, 2024. arXiv:2405.21060
  17. GRPO: Group Relative Policy Optimization, introduced in DeepSeek Math, 2024. arXiv:2402.03300

本文基于公开技术报告撰写,所有数据和技术细节均来自原始资料。部分模型的技术报告信息详尽程度不同,因此各部分的覆盖深度存在差异。