02-产品与技术-385人的多模态战争
产品与技术——385人的多模态战争
《看懂MINIMAX》系列 · 第 02 篇 阅读时间约 10 分钟
385人,四条战线,每条都打进全球前列
OpenAI有3,000人,Google DeepMind有2,000人,字节AI团队数千人。MINIMAX只有385人——平均年龄29岁——却同时在AI社交、视频生成、语音合成、通用大模型四条线上做到了行业前列。语音合成全球第一,视频生成全球第一梯队,Talkie海外MAU突破千万。
这种人效比找不到第二个案例可比。但"找不到第二个案例"本身就值得追问:这究竟是顶级的执行力,还是幸存者偏差放大了我们看到的成绩?逐一拆解。
一、Talkie——海外AI社交的隐形冠军
产品定位
Talkie(海外)和星野(国内)是MINIMAX的AI角色扮演社交产品。用户可以和AI角色自由对话,也可以自己创建角色、设定人格。它不是工具型AI(不像ChatGPT回答问题),而是娱乐和陪伴型AI——用户来这里不是为了生产力,是为了"和AI做朋友"。
关键数据
| 指标 | 数值 | 来源 |
|---|---|---|
| 累计用户 | 1.47亿 | MiniMax 2025年报 |
| 全球MAU | 2,760万 | MiniMax 2025年报(截至2025年9月) |
| 海外MAU | 1,100万(50%+来自美国) | MiniMax招股书 |
| 日活用户 | 近千万 | MiniMax财报电话会 |
| 日均使用时长 | 70分钟 | MiniMax财报电话会 |
| 2025年收入 | 1,875万美元(同比+39%) | MiniMax 2025年报(截至9月数据) |
70分钟日均使用时长——这个数字非常惊人。作为对比,TikTok的日均使用时长约55分钟,Instagram约30分钟。如果数据可信,说明Talkie的用户粘性极强。
竞争格局
| 产品 | 公司 | 现状 |
|---|---|---|
| Character.AI | 被Google收编 | 先行者,用户规模更大,但独立性丧失,创新速度下降 |
| Talkie | MINIMAX | 海外增长最快的中国AI社交产品,角色丰富度高,社区活跃 |
| Chai | 独立公司 | 规模较小 |
| Janitor AI | 独立公司 | 偏成人向,小众 |
Character.AI被Google收编后,创始团队回到Google DeepMind,产品层面的创新明显放缓。这给了Talkie一个窗口期。
核心优势:
- 用户生态——UGC角色创建形成弱网络效应,角色越多、用户越多、创作者越多
- 多模态融合——Talkie的角色可以有语音(基于Speech-02),这是Character.AI没有的
- 海外本土化——美国、菲律宾、英国等市场的Z世代用户高度活跃
核心风险:
- AI应用留存率普遍堪忧——新鲜感消退后活跃度是否能维持?
- ARPU极低——AI社交的付费意愿远低于游戏和流媒体
- Google随时可能重新发力——Character.AI的技术和用户基础还在Google手里
- 版权和安全合规——Talkie曾在日本和美国被下架过
反方观点:70分钟日均时长可能是被少数重度用户拉高的。真正的问题不是MAU多少,而是有多少人愿意掏钱。目前Talkie的ARPU可能只有1-2美元/月(估计),远低于Netflix的15美元/月。
二、海螺AI——视频生成赛道的中国选手
产品定位
海螺AI是MINIMAX旗下的AI视频生成工具,海外品牌名为Hailuo AI。用户输入文字或图片,即可生成视频。
技术水平
最新的Hailuo 02支持1080p原生分辨率,采用Noise-aware Compute Redistribution(NCR)核心架构,在生成速度、画质、物理表现上处于全球第一梯队。
| 产品 | 公司 | 画质 | 速度 | 用户规模 |
|---|---|---|---|---|
| Sora | OpenAI | 顶级 | 慢 | 受限于ChatGPT Plus订阅 |
| 可灵(Kling) | 快手 | 高 | 快 | 数百万用户(估计) |
| Hailuo 02 | MINIMAX | 高 | 快 | 全球数百万用户 |
| 即梦 | 字节 | 中高 | 快 | 快速增长 |
| Runway Gen-3 | Runway | 高 | 中 | 海外专业用户 |
海螺AI的2025年收入为1,746万美元(截至9月),是MINIMAX第二大收入来源。
迪士尼版权诉讼——绕不过的坎
2025年9月,迪士尼、环球影业、华纳兄弟在美国加州联邦法院联合起诉MINIMAX,指控海螺AI在训练和生成过程中侵犯了超过50个影视作品IP的版权。
诉讼要点:
- 原告要求每件被侵权作品赔偿最高15万美元,50件合计最高750万美元
- 另外要求法院发出禁令,禁止海螺AI继续侵权
- 原告指出海螺AI已经有内容过滤机制(能拦截暴力和色情内容),但选择不拦截版权内容
MINIMAX在招股书中回应:考虑到潜在跟进诉讼等更广泛情景,最坏情景下赔偿可能达7,500万美元,相对公司财务资源"比例有限"。(注:此数字为招股书中的最坏情景估算,高于本案原告诉求的750万美元上限。)
冷静分析:赔偿金额本身不致命,但禁令风险才是关键——如果法院禁止海螺AI在美国运营,将直接打击海外业务。此外,这起诉讼可能引发更多版权持有者跟进起诉。
反方观点:AI公司被版权诉讼几乎是行业通病——OpenAI、Stability AI、Midjourney都面临类似诉讼。最终大概率以和解或许可费方式解决。但和解金额和条件仍有不确定性。
三、Speech-02——语音合成全球第一
核心成绩
MINIMAX的Speech-02在两个全球权威语音评测榜单同时登顶:
| 榜单 | 排名 | ELO分数 |
|---|---|---|
| Artificial Analysis Speech Arena | 第1 | 1161 |
| Hugging Face TTS Arena | 第1和第2(HD和Turbo双版本包揽) | 第1 |
在这两个榜单上,Speech-02超越了OpenAI的TTS和ElevenLabs——而ElevenLabs是此前公认的语音合成之王。
技术特点
- 人声相似度达到99%
- 价格仅为ElevenLabs Flash V2.5的一半,Multilingual V2的四分之一
- 服务超过5万家企业
商业化潜力
语音合成是一个确定性较高的垂直赛道:有声书、播客、客服、游戏配音、视频旁白——每个场景都有真实的付费需求。全球TTS市场规模约100-150亿美元(2025年估计),增速约70%/年。
Speech-02可能是MINIMAX最被低估的资产——它不像Talkie那样吸引眼球,但商业化路径更清晰、壁垒更高(语音合成的训练数据和效果调优需要深厚积累)。
反方观点:语音合成市场虽然增速快,但天花板有限。而且OpenAI和Google都在加大语音投入——全球第一的位置能保持多久?
四、M2.7大模型——用1%的成本追赶OpenAI
核心参数
| 指标 | M2.7 | 对比 |
|---|---|---|
| 架构 | MoE(混合专家) | 与DeepSeek-V3同一技术路线 |
| 总参数 | 2,300亿 | — |
| 激活参数 | 100亿 | 推理成本低 |
| 上下文长度 | 200K tokens | 约40万中文字 |
| SWE-Pro得分 | 56.22% | 接近GPT-5.3-Codex |
| VIBE-Pro得分 | 55.6% | — |
| Terminal Bench 2得分 | 57.0% | — |
| 研发成本 | 约为OpenAI的1% | MiniMax招股书 |
M2.7最独特的能力是自我进化——在研发过程中,模型自行构建强化学习Harness中的复杂Skills,更新Memory,驱动自身的强化学习,并基于结果优化学习过程。这是MINIMAX提出的"首个深度参与迭代自己的模型"概念。
性价比优势
M2.7的推理价格仅为Opus 4.6的1/10到1/20。2026年初以来,M2系列推理算力成本又进一步下降超50%。
在纯文本能力上,M2.7不是最强的——DeepSeek、GPT-5系列、Gemini 3 Pro在复杂推理上仍然领先。但M2.7的定位不是"纯文本最强",而是多模态综合能力最优:文本+语音+视频+音乐的一体化能力,目前没有竞品能完全匹配。
开放平台数据
| 指标 | 数值 |
|---|---|
| 企业客户和开发者 | 21.4万,覆盖100+国家 |
| 2025年开放平台收入 | 2,596万美元(同比+197.8%) |
| 2026年2月新注册用户 | 达2025年12月的4倍以上 |
开放平台(B端API)是增速最快的业务线,也是未来潜在的主要收入来源。
反方观点:API市场正在经历惨烈价格战。DeepSeek把价格压到极低,字节豆包的API调用量已是天文数字(日均50万亿Token)。MINIMAX的API定价权极弱——被市场推着走。
多模态能力对比:MINIMAX到底排第几
把四个维度放在一起看:
| 能力 | MINIMAX | 字节 | 阿里 | DeepSeek | OpenAI |
|---|---|---|---|---|---|
| 文本生成 | ★★★☆ | ★★★★ | ★★★★ | ★★★★★ | ★★★★★ |
| 语音合成 | ★★★★★ | ★★★★ | ★★★ | ★★ | ★★★★ |
| 视频生成 | ★★★★★ | ★★★★ | ★★★ | ★ | ★★★★ |
| 音乐生成 | ★★★★ | ★★★ | ★★ | ★ | ★★ |
| 多模态融合 | ★★★★ | ★★★★ | ★★★ | ★★ | ★★★★ |
MINIMAX的差异化非常清晰:纯文本打不过,但语音+视频+音乐的多模态综合能力目前全球领先。
这个差异化能持续多久?下一篇拆竞争格局时详细分析。
385人效率之谜:真功夫还是幸存者偏差?
385人,平均年龄29岁,研发占比74%(约285人),组织结构只有三个层级。用不到巨头1/10的人力,做出了上述成绩。
看多视角:高人才密度、低沟通成本、快速决策。闫俊杰的CMU博士背景+商汤副总裁经历,能吸引顶尖人才。小团队比大团队更灵活。
看空视角:小团队抗风险能力弱,几个核心人才离职就可能动摇根基。AI竞赛越往后越依赖算力和数据——这两样东西不是小团队能拼的。
下期预告
下一篇,我们会拆MINIMAX面对的竞争格局——字节豆包的降维打击、DeepSeek的开源颠覆、巨头与创业公司的资源鸿沟。
要回答的几个尖锐问题:
- 字节豆包MAU 2.26亿、日均Token 50万亿——MINIMAX拿什么抗衡?
- DeepSeek重新定义了AI的成本结构——MINIMAX的闭源路线还有出路吗?
- “好赛道、坏生意”——AI大模型行业的终局是什么?
- MINIMAX最终的命运是独立存活还是被收购?
下篇见。
本文是《看懂MINIMAX》系列第 02 篇。
免责声明:本文不构成任何投资建议。文中数据来源于公开财报、招股书和第三方平台,可能存在时效性偏差。投资决策请基于最新信息和独立判断。
数据来源:MiniMax 2025年报、招股书、InfoQ、量子位、36氪、Artificial Analysis Arena、Hugging Face TTS Arena
