02-技术路线-MoE架构、开源策略与训练效率突破
技术路线——MoE架构、开源策略与训练效率突破
《看懂DeepSeek》系列 · 第 02 篇 阅读时间约 10 分钟
为什么要先讲技术?
一家270人的团队,用560万美元训练出全球前沿大模型。这件事如果只是运气,就没有研究价值;如果是结构性的——它就改变了整个AI行业的竞争逻辑。
判断这件事,只有一条路:把技术路线看懂。这篇会尽量用非技术语言把四个核心创新说清楚。
创新一:MoE架构——用1/10的电费做同等量级的计算
什么是MoE?
传统大模型(如早期GPT-4)是"稠密模型"——每次推理,所有参数都参与计算。1万亿参数的模型,每个问题都要动用全部1万亿参数。
MoE(Mixture of Experts,混合专家)的思路完全不同:把模型拆成多个"专家模块",每次推理只激活其中一小部分。
类比:一家有500个律师的律所,客户来了不是500人一起上,而是根据案件类型只派5个最相关的专家。
DeepSeek V3的数据:
| 指标 | 数值 |
|---|---|
| 总参数 | 6,710亿(671B) |
| 每次激活参数 | 370亿(37B) |
| 激活比例 | 约5.5% |
V4-Pro更进一步:
| 指标 | 数值 |
|---|---|
| 总参数 | 1.6万亿(1.6T) |
| 每次激活参数 | 490亿(49B) |
| 激活比例 | 约3% |
(来源:DeepSeek技术论文、Hugging Face模型页面)
这意味着什么? V4-Pro拥有1.6万亿参数的"知识容量",但每次计算只消耗490亿参数的算力成本。知识的广度和推理的效率,两者兼得。
反方观点:MoE并非DeepSeek的发明——Google的Switch Transformer(2021年)、Mixtral(2024年)都在用MoE。DeepSeek的贡献在于把MoE在超大规模上做到了工程极致,但这并不意味着其他公司无法复制。事实上,V4发布后数周内,多个实验室已经在研究类似架构。
MoE的关键优势
| 优势 | 说明 |
|---|---|
| 训练成本低 | V3训练仅560万美元,同等性能的稠密模型需要上亿美元 |
| 推理成本低 | 每次只激活3-5%参数,单次推理电费大幅降低 |
| 扩展性好 | 可以不断加"专家"而不等比增加推理成本 |
创新二:MLA注意力机制——解决长文本的内存瓶颈
大模型在处理长文本时有一个技术瓶颈:KV-cache(键值缓存)会随上下文长度线性增长,消耗大量GPU显存。
DeepSeek的MLA(Multi-head Latent Attention) 通过对注意力头进行低秩压缩,大幅降低KV-cache的内存占用。
V4在此基础上进一步引入CSA(压缩稀疏注意力) 和 HCA(重度压缩注意力) 混合机制:
| 指标 | 对比V3 |
|---|---|
| 单token推理计算量 | 仅为V3的27% |
| KV-cache占用 | 仅为V3的10% |
| 上下文窗口 | 从128K扩展到100万tokens |
(来源:DeepSeek V4技术论文)
为什么这很重要? 100万tokens的上下文窗口意味着可以一次读入一整本书、一整个代码库。而KV-cache的压缩意味着这个能力的硬件成本大幅降低——不是靠堆更贵的GPU,而是靠更聪明的算法。
创新三:FP8混合精度训练与R1-Zero
FP8训练
传统大模型用FP16(16位浮点数)或BF16进行训练。DeepSeek V3是第一个成功用FP8(8位浮点数)完成完整训练的开源大模型。
位数减半,直接的效果:
- 内存占用减半
- 计算吞吐量几乎翻倍
- 训练总成本进一步降低
(来源:DeepSeek V3 arXiv论文)
反方观点:FP8训练在学术界已有讨论多年,NVIDIA的H100/H200本身就支持FP8算力。DeepSeek的贡献是第一个在超大规模模型上跑通了FP8训练的完整流水线,但这项技术会迅速被行业跟进。
R1-Zero:纯强化学习的里程碑
2025年1月,DeepSeek R1发布时附带了一个研究成果——R1-Zero。
传统训练大模型的推理能力,需要先用人工标注的"思维链"数据做监督微调(SFT),再做强化学习(RL)。这个过程依赖大量人工标注。
R1-Zero的突破是:完全跳过监督微调,仅用强化学习,模型就自发涌现出了推理链。
这被学术界视为一个标志性事件——它暗示:推理能力可能不需要人类手把手教,AI可以通过自我博弈学会"思考"。
反方观点:R1-Zero在实际性能上不如经过SFT+RL完整流程的R1。它的学术意义大于工程意义。但它验证了一条理论路径,这条路径的长期影响可能远超短期基准测试分数。
创新四:全MIT开源——护城河还是自掘坟墓?
DeepSeek的所有核心模型——V3、R1、V4——全部以MIT协议开源。这是最宽松的开源协议之一,意味着:
- 任何人可以免费下载模型权重
- 可以用于商业用途
- 不要求对修改版本也开源
- 训练代码和工具也全部公开
38%的2025年Q1新AI论文引用了DeepSeek的工具或数据集(来源:DemandSage统计)。Hugging Face上,DeepSeek模型月下载量超过80万次。
开源策略的利与弊
| 维度 | 看多(护城河说) | 看空(自毁说) |
|---|---|---|
| 生态 | 开发者生态一旦建成极难迁移 | 别人拿走代码训自己的模型 |
| 人才吸引 | 全球顶级研究者愿意为开源项目贡献 | 核心知识产权免费送出 |
| 品牌 | “AI界的Linux”——影响力巨大 | Linux基金会不赚钱 |
| 商业 | API低价+开源=占领开发者市场 | 竞争对手用你的模型做出竞品 |
| 安全 | 代码透明→安全审计更充分 | 恶意使用者可以去除安全限制 |
一个不可忽视的事实:截至2026年5月,DeepSeek在开源大模型领域排名全球第一,GitHub仓库累计超过7万星(来源:GitHub)。在"开源AI"这条赛道上,DeepSeek已经建立了显著的先发优势。
但另一个事实同样不可忽视:Anthropic(Claude)和OpenAI走的是完全相反的闭源路线,两者在商业化上都远远领先于DeepSeek。开源的影响力能否转化为可持续的竞争优势,至今没有定论。
V4适配华为昇腾:一个关键转折
2026年4月24日,DeepSeek V4发布时有一个容易被忽略的细节:同步宣布全面支持华为昇腾950芯片。
这意味着:
| 变化 | 之前 | 之后 |
|---|---|---|
| 训练依赖 | 主要依赖NVIDIA H800 | 开始适配华为昇腾 |
| 推理部署 | CUDA生态(NVIDIA) | CANN框架(华为) |
| 供应链风险 | 极高(美国芯片禁令) | 有备份路线 |
华为昇腾950超级节点在V4-Pro上实现了单卡解码吞吐4,700 TPS、首token延迟约20ms(来源:华为计算、科学网)。
这是第一次一个世界级开源大模型在国产芯片上实现了从训练到推理的全栈部署,不依赖任何NVIDIA硬件。
反方观点:昇腾芯片与NVIDIA最新的H200/B100相比仍有性能差距。华为自身产能爬坡需要时间——V4-Pro的高端推理服务目前因算力受限,价格预计要到2026年下半年昇腾950量产后才能大幅下降。“去美化"是方向,但远未完成。
技术领先能持续多久?
这是最难回答的问题。直接给出正反两面:
看多的理由
- 算法创新的组织能力:270人团队持续产出V3→R1→V4三代突破性成果,说明团队的"研究密度"极高
- 成本优势有复利效应:训练成本低→迭代速度快→成本进一步降低
- 开源生态壁垒:全球38%新论文引用,开发者生态一旦锁定很难迁移
- 国产芯片适配先行:在昇腾上的经验会成为后续国产替代的标杆
看空的理由
- MoE架构不是秘密:技术论文全部公开,竞对可以快速跟进
- 人才流失已在发生:2025年底至2026年初,多名核心成员离职加入小米、腾讯、字节跳动(来源:36氪)
- 无股权激励:270人的精英团队没有上市公司的股权锁定机制
- 芯片差距:昇腾适配降低了供应链风险,但训练前沿模型的效率仍可能受限
一个比较审慎的判断是:技术领先大概率能维持1-2年。3年以上的领先取决于团队稳定性、芯片供应和对手的追赶速度——这些都有很大不确定性。
下期预告
技术只是起点。下一篇,我们要回答一个更尖锐的问题——这个实验室的钱从哪来?能走多远?
要拆解的问题:
- 幻方量化到底是什么?它的利润能支撑DeepSeek多久?
- 首轮融资500亿元意味着什么?“理想主义"还在吗?
- 与OpenAI、Anthropic、Google的竞争,DeepSeek处于什么位置?
- “不商业化"是战略还是无奈?
本文是《看懂DeepSeek》系列第 02 篇。 本系列不构成任何投资建议。所有数据来源已在文中标注,如有错误欢迎指正。
