目录

01-开篇-震动全球AI行业的中国实验室

DeepSeek——震动全球AI行业的中国实验室

《看懂DeepSeek》系列 · 第 01 篇 · 开篇 阅读时间约 8 分钟


一组让你重新理解AI竞争格局的事实

2025年1月27日,一个没有人听说过的名字——DeepSeek——登上美区App Store第一。它不是OpenAI,不是Google,不是任何一家硅谷公司。它来自杭州,成立不到两年,从未融过一分钱外部资金。

然后,美股历史上最大单日市值蒸发事件发生了:

  • 英伟达单日暴跌17%,市值蒸发约6,000亿美元——美股有史以来最大单日市值损失(来源:Bloomberg)
  • AI板块当日总计蒸发约1万亿美元
  • 被西方媒体称为AI领域的"斯普特尼克时刻"(来源:MIT Technology Review)
  • 全球科技行业开始重新审视"只有烧钱才能做AI"的信仰

做出这一切的,是一家成立不到两年、从未融过一分钱外部资金的中国公司。


DeepSeek到底是什么?

先把最基本的信息摆清楚:

项目内容
全名深度求索(DeepSeek)
创始人梁文锋,1985年生,浙江大学毕业
成立时间2023年7月,杭州
团队规模270人,平均年龄28岁
外部融资成立至2026年4月:(全部来自幻方量化自有资金)
母公司幻方量化(量化对冲基金,管理规模700亿+
2026年5月估值3,500亿元(~$450亿美元)(来源:华尔街见闻、新浪财经)

一句话概括:DeepSeek是一个由量化基金利润供养的AI研究实验室,用极少的人和极低的成本,做出了全球前沿水平的大模型。


三件必须知道的事

第一件:它不是一家公司,更像一个实验室

DeepSeek的创始人梁文锋反复强调:DeepSeek的目标不是赚钱,而是"无限制的研究"。

这句话不是口号。看证据:

  • API定价极低:V4输入价格**$0.30/百万tokens**,是GPT-5.4的约1/20(来源:DeepSeek官方API定价)
  • 所有核心模型全部MIT协议开源——权重、训练代码全部公开
  • 创始人从未公开做过商业化路演
  • 成立两年半,靠母公司幻方量化的利润输血,不找外部投资者

反方观点:2026年5月,DeepSeek终于启动首轮融资,目标500亿元,梁文锋个人出资200亿元,国家大基金洽谈领投(来源:新浪财经、36氪)。这意味着"不融资的理想主义"正在转向。至于是被现实逼迫还是主动选择,还需要观察。

第二件:它用1/20的成本做到了一流的性能

DeepSeek V3(2024年12月发布)的训练成本仅560万美元,约为GPT-4训练成本的1/20(来源:DeepSeek技术论文)。

2026年4月发布的V4-Pro更进一步:

指标DeepSeek V4-ProGPT-5.4Claude Opus 4.6
总参数1.6万亿未公开未公开
激活参数490亿未公开未公开
上下文窗口100万tokens100万+100万
LiveCodeBench93.5(最高分)未公开未公开
SWE-bench80.6%接近接近
Codeforces32063168未公开
API输入价格$0.30/M tokens~$6/M~$15/M

(来源:DeepSeek官方、NoteLM、OfficeChai)

数据说得很清楚:DeepSeek V4在编程和推理基准上已进入全球第一梯队,而价格只有竞品的1/10到1/50。

反方观点:在数学推理(HMMT 2026)上,Claude Opus 4.6得分96.2、GPT-5.4得分97.7,而V4-Pro为95.2——差距不大但确实存在。在MMLU-Pro上,V4-Pro(87.5%)也落后于Gemini 3.1 Pro(91.0%)。“全面超越"的说法并不准确,更准确的判断是"特定领域领先、整体进入第一梯队”。

第三件:“DeepSeek震撼"改变了整个AI行业的叙事

2025年1月R1发布之前,全球AI行业的核心信仰是——规模即一切:更多GPU、更多数据、更多资金,才能做出更好的模型。

R1用事实证伪了这个信仰:

  • 671B参数、仅激活37B——计算量降低约90%
  • 训练成本560万美元(V3)+ 额外**~29.4万美元**(R1纯RL训练)
  • 性能与GPT-4一代模型相当

这个冲击有多大?看英伟达的股价就够了——单日蒸发6,000亿美元,因为市场突然意识到:“也许AI公司不需要买那么多GPU。”

但11个月后发生了什么? 英伟达股价完全恢复。原因是杰文斯悖论(Jevons Paradox):成本降低→门槛降低→更多公司和场景使用AI→算力总需求反而增加。

这个悖论目前看来是对的。但它不能抹杀DeepSeek证明的那件事:算法创新可以弥补算力差距。


为什么要用一个系列来写DeepSeek?

因为DeepSeek是一个多层嵌套的评估难题

问题复杂度
技术MoE架构+开源策略能走多远?需要理解技术路线
商业“不赚钱"能持续多久?首轮融资意味着什么?需要看清商业逻辑
地缘政治芯片禁令+海外封禁对它的影响?需要评估外部风险
母公司幻方量化的盈利能力能支撑多久?需要分析资金来源
人才270人的精英团队稳定吗?需要看核心人员流动

这些问题交织在一起,不能单独看任何一层。

接下来三篇,会依次拆开:

#篇名核心问题
02技术路线——MoE、开源与训练效率技术护城河到底有多深?
03商业与竞争——幻方背景、变现与对手不赚钱的模式能走多远?
04风险与判断——芯片、监管与长期价值这家实验室值不值得关注?

下期预告

下一篇,我们会拆DeepSeek最核心的东西——技术路线

要回答几个尖锐问题:

  • MoE架构到底是什么?为什么它让DeepSeek用1/20的成本追上一线水平?
  • “全部开源"对DeepSeek是护城河还是自毁长城?
  • R1-Zero的"纯强化学习训练"为什么被视为AI研究的里程碑?
  • V4适配华为昇腾芯片意味着什么?

本文是《看懂DeepSeek》系列第 01 篇。后续 3 篇将陆续推出。 本系列不构成任何投资建议。所有数据来源已在文中标注,如有错误欢迎指正。