01-开篇-震动全球AI行业的中国实验室
DeepSeek——震动全球AI行业的中国实验室
《看懂DeepSeek》系列 · 第 01 篇 · 开篇 阅读时间约 8 分钟
一组让你重新理解AI竞争格局的事实
2025年1月27日,一个没有人听说过的名字——DeepSeek——登上美区App Store第一。它不是OpenAI,不是Google,不是任何一家硅谷公司。它来自杭州,成立不到两年,从未融过一分钱外部资金。
然后,美股历史上最大单日市值蒸发事件发生了:
- 英伟达单日暴跌17%,市值蒸发约6,000亿美元——美股有史以来最大单日市值损失(来源:Bloomberg)
- AI板块当日总计蒸发约1万亿美元
- 被西方媒体称为AI领域的"斯普特尼克时刻"(来源:MIT Technology Review)
- 全球科技行业开始重新审视"只有烧钱才能做AI"的信仰
做出这一切的,是一家成立不到两年、从未融过一分钱外部资金的中国公司。
DeepSeek到底是什么?
先把最基本的信息摆清楚:
| 项目 | 内容 |
|---|---|
| 全名 | 深度求索(DeepSeek) |
| 创始人 | 梁文锋,1985年生,浙江大学毕业 |
| 成立时间 | 2023年7月,杭州 |
| 团队规模 | 约270人,平均年龄28岁 |
| 外部融资 | 成立至2026年4月:零(全部来自幻方量化自有资金) |
| 母公司 | 幻方量化(量化对冲基金,管理规模700亿+) |
| 2026年5月估值 | 约3,500亿元(~$450亿美元)(来源:华尔街见闻、新浪财经) |
一句话概括:DeepSeek是一个由量化基金利润供养的AI研究实验室,用极少的人和极低的成本,做出了全球前沿水平的大模型。
三件必须知道的事
第一件:它不是一家公司,更像一个实验室
DeepSeek的创始人梁文锋反复强调:DeepSeek的目标不是赚钱,而是"无限制的研究"。
这句话不是口号。看证据:
- API定价极低:V4输入价格**$0.30/百万tokens**,是GPT-5.4的约1/20(来源:DeepSeek官方API定价)
- 所有核心模型全部MIT协议开源——权重、训练代码全部公开
- 创始人从未公开做过商业化路演
- 成立两年半,靠母公司幻方量化的利润输血,不找外部投资者
反方观点:2026年5月,DeepSeek终于启动首轮融资,目标500亿元,梁文锋个人出资200亿元,国家大基金洽谈领投(来源:新浪财经、36氪)。这意味着"不融资的理想主义"正在转向。至于是被现实逼迫还是主动选择,还需要观察。
第二件:它用1/20的成本做到了一流的性能
DeepSeek V3(2024年12月发布)的训练成本仅560万美元,约为GPT-4训练成本的1/20(来源:DeepSeek技术论文)。
2026年4月发布的V4-Pro更进一步:
| 指标 | DeepSeek V4-Pro | GPT-5.4 | Claude Opus 4.6 |
|---|---|---|---|
| 总参数 | 1.6万亿 | 未公开 | 未公开 |
| 激活参数 | 490亿 | 未公开 | 未公开 |
| 上下文窗口 | 100万tokens | 100万+ | 100万 |
| LiveCodeBench | 93.5(最高分) | 未公开 | 未公开 |
| SWE-bench | 80.6% | 接近 | 接近 |
| Codeforces | 3206 | 3168 | 未公开 |
| API输入价格 | $0.30/M tokens | ~$6/M | ~$15/M |
(来源:DeepSeek官方、NoteLM、OfficeChai)
数据说得很清楚:DeepSeek V4在编程和推理基准上已进入全球第一梯队,而价格只有竞品的1/10到1/50。
反方观点:在数学推理(HMMT 2026)上,Claude Opus 4.6得分96.2、GPT-5.4得分97.7,而V4-Pro为95.2——差距不大但确实存在。在MMLU-Pro上,V4-Pro(87.5%)也落后于Gemini 3.1 Pro(91.0%)。“全面超越"的说法并不准确,更准确的判断是"特定领域领先、整体进入第一梯队”。
第三件:“DeepSeek震撼"改变了整个AI行业的叙事
2025年1月R1发布之前,全球AI行业的核心信仰是——规模即一切:更多GPU、更多数据、更多资金,才能做出更好的模型。
R1用事实证伪了这个信仰:
- 671B参数、仅激活37B——计算量降低约90%
- 训练成本560万美元(V3)+ 额外**~29.4万美元**(R1纯RL训练)
- 性能与GPT-4一代模型相当
这个冲击有多大?看英伟达的股价就够了——单日蒸发6,000亿美元,因为市场突然意识到:“也许AI公司不需要买那么多GPU。”
但11个月后发生了什么? 英伟达股价完全恢复。原因是杰文斯悖论(Jevons Paradox):成本降低→门槛降低→更多公司和场景使用AI→算力总需求反而增加。
这个悖论目前看来是对的。但它不能抹杀DeepSeek证明的那件事:算法创新可以弥补算力差距。
为什么要用一个系列来写DeepSeek?
因为DeepSeek是一个多层嵌套的评估难题:
| 层 | 问题 | 复杂度 |
|---|---|---|
| 技术 | MoE架构+开源策略能走多远? | 需要理解技术路线 |
| 商业 | “不赚钱"能持续多久?首轮融资意味着什么? | 需要看清商业逻辑 |
| 地缘政治 | 芯片禁令+海外封禁对它的影响? | 需要评估外部风险 |
| 母公司 | 幻方量化的盈利能力能支撑多久? | 需要分析资金来源 |
| 人才 | 270人的精英团队稳定吗? | 需要看核心人员流动 |
这些问题交织在一起,不能单独看任何一层。
接下来三篇,会依次拆开:
| # | 篇名 | 核心问题 |
|---|---|---|
| 02 | 技术路线——MoE、开源与训练效率 | 技术护城河到底有多深? |
| 03 | 商业与竞争——幻方背景、变现与对手 | 不赚钱的模式能走多远? |
| 04 | 风险与判断——芯片、监管与长期价值 | 这家实验室值不值得关注? |
下期预告
下一篇,我们会拆DeepSeek最核心的东西——技术路线。
要回答几个尖锐问题:
- MoE架构到底是什么?为什么它让DeepSeek用1/20的成本追上一线水平?
- “全部开源"对DeepSeek是护城河还是自毁长城?
- R1-Zero的"纯强化学习训练"为什么被视为AI研究的里程碑?
- V4适配华为昇腾芯片意味着什么?
本文是《看懂DeepSeek》系列第 01 篇。后续 3 篇将陆续推出。 本系列不构成任何投资建议。所有数据来源已在文中标注,如有错误欢迎指正。
