目录

大模型分析-20260430

目录

蚂蚁数科基础大模型路线深度分析(2026/04/30)

分析对象:蚂蚁数科(Ant Digital Technologies)做基础大模型(LLM、语音、多模态)的成功可能性

三个核心问题

  1. 基础大模型路线能否成功?
  2. 是否能找到 PMF?
  3. 相比通用基模厂商(千问/豆包/DeepSeek/智谱/文心一言/Kimi)的差异化价值?

报告原则:客观、不预设立场、正反两面、数据标注来源、估算明确标注

重要边界:本报告基于纯公开信息,不包含任何内部视角,不涉及任何个人隐私。


TL;DR:一页纸结论

核心问题结论概率/信心
1. 5年内做出"被市场认可的基础大模型"极低概率走通"自研通用基模与千问/豆包正面竞争"路径;中高概率走通"垂直金融大模型+Agent平台"路径通用路径**<10%;垂直路径40-55%**
2. 找到 PMF路径A(自研通用LLM):<5%;路径B(垂直金融基模第一):30-40%;路径C(智能体+长记忆+工具链组合):50-65%;路径D(IT集成的"配角",靠服务+数据收费):70-85%路径越垂直、越服务化,概率越高
3. 真正的差异化价值真差异化:金融场景 know-how、合规级数据壁垒、私有部署+审计闭环;伪差异化:基模能力、算力规模、开源生态

一句话总结:蚂蚁数科要"做基础大模型"成功的真正路径不是与 DeepSeek/Qwen/豆包正面卷通用基模能力,而是把母公司百灵开源底座 + 自家金融场景数据 + Agent 平台 + 合规与审计闭环做成一个对金融、能源、政务客户而言"开箱即用、合规放心"的行业级 AI 基础设施——本质上是高毛利的 AI 服务公司,而不是基础大模型公司。


第一部分:蚂蚁数科大模型布局现状(已知什么)

1.1 大模型技术创新部成立背景与战略意图

事实新浪科技 2026-02-04OFweek 2026-02):

  • 2026年2月3日/4日:蚂蚁数科 CEO 赵闻飙发全员信,宣布成立"大模型技术创新部"
  • 战略定位:“专啃 To B 场景基础大模型与行业模型的硬骨头”
  • 组织架构:双线汇报——技术路线直接向 CEO 汇报,业务落地接受集团 CTO 办公室协调
  • 目标:“让 AI 走出实验室,成为企业数字员工”
  • 与百灵基模团队关系:合作关系,蚂蚁集团百灵团队提供基础大模型,数科负责 To B 场景落地

行业大背景新浪财经 2026-02):

  • 同期蚂蚁集团 CEO 韩歆毅 2026-02-02 发全员信,推出"AI Credit"特别激励方案
  • 集团明确"AI 探索未到庆功时刻",全员动员"全面 AI 化"
  • 战略三足:支付(蚂蚁主业)、金融(蚂蚁数科核心客群)、健康(阿福)

观察:从时序看,蚂蚁数科的"大模型技术创新部"是集团 AI 战略大动员的一部分,不是数科独立的战略选择,而是集团"全面 AI 化"在数科板块的承接。这意味着数科做基础大模型的资源优先级,受制于集团对支付、金融、健康三条战略主线的整体分配。

1.2 现有产品矩阵

层次产品类型状态关键数据
基础大模型层(百灵基模团队)Ling-2.5-1T / Ling-2.6-1T通用LLM(万亿参数 MoE)开源2026-04 发布 Ling-2.6-1T,对标 GPT-5.4(ITBear 2026-04
同上Ring-2.5-1T万亿参数推理模型开源2026-02-13,全球首个混合线性架构万亿思考模型(量子位 2026-02
同上Ming-Flash-Omni 2.0全模态(语言+视觉+音频+图像编辑)开源2026-02-11,对标 Gemini 2.5 Pro,推理帧率 3.1Hz(InfoQ 2026-02
金融垂直模型层(数科)Agentar-Fin-R1金融推理模型(基于 Qwen3)已发布2025-07-28 WAIC 发布,FinEval 1.0 87.70 分,FinanceIQ 86.79 分,超 DeepSeek-R1(新浪财经 2025-07
同上Agentar-Scale-SQLNL2SQL 数据分析智能体开源2025-12 登顶 BIRD-SQL(92% 准确率,超谷歌3倍)(量子位 2025-12
应用层(数科)Agentar 智能体平台企业级 Agent 开发平台商用2026-04 被 IT之家、CSDN 评为"综合优选"(IT之家 2026-04
同上百灵大模型企业版ToB 私有化部署版待发布2026-02-19 宣布即将推出(腾讯新闻 2026-02
同上mPaaS / SOFAStack / 蚂蚁链中间件+区块链+隐私计算商用蚂蚁链 BaaS 市占 24.4%(连续4年第一)

关键观察

  1. 数科本身不做"基础大模型预训练"——所有的 Ling/Ring/Ming 系列都是百灵基模团队(属于蚂蚁集团而非数科)开发并开源。数科更像 集团基模成果的 ToB 商业化通道 + 行业垂直层封装

  2. 真正属于数科原创的"大模型":Agentar-Fin-R1 也不是从零训练的基模,而是基于 Qwen3 微调的金融推理模型——这是一个重要的事实底线。

  3. 2026 年定位:数科的"大模型技术创新部"成立的实质,是把百灵的开源底座+金融场景数据+Agentar Agent 平台整合成一个 ToB 售卖的产品组合,不是去做新一代万亿参数基模

1.3 技术能力盘点

能力实际水平来源/置信度
自研基础大模型(预训练)弱(依赖集团百灵)🟢
垂直微调能力强(Agentar-Fin-R1 在多个金融 benchmark 超 DeepSeek-R1)🟢
检索增强(RAG)强(KBase 知识工程平台,宁波银行落地)🟢
智能体(Agent)强(Agentar-SQL 登顶 BIRD,中国信通院最高级别认证)🟢
多模态(语音+视觉+音频)中-强(Ming-Flash-Omni 2.0 部分指标超 Gemini 2.5 Pro,但属于集团百灵团队)🟡
长记忆/工具链中(百灵企业版主打"幻觉抑制+指令遵循+Agentic Engineering")🟡
私有化部署强(金融客户私有部署是核心场景)🟢
合规/审计闭环强(金融级合规、信通院最高级别认证、Agentar 入选"2025国际标准金融应用卓越案例")🟢

1.4 算力资源

事实新浪财经 2025-03OSCHINA):

  • 蚂蚁集团采用国产 AI 芯片(壁仞、天数智芯、寒武纪等)训练大模型,1万亿 token 预训练成本从 635 万降至 508 万元,降幅约20%
  • 自研 Ling 系列 MoE 模型(2900亿参数,288亿激活),证明可在国产 GPU 上完成高效训练
  • 训练效果"不输英伟达 H800"(蚂蚁集团内部测试口径)

估算(基于公开口径推断,🟡 中等置信度):

  • 蚂蚁集团整体 AI 算力规模:估计在万卡级别(H800/H100/国产芯片混合),全部由集团统一调度
  • 蚂蚁数科本身没有独立的 GPU 集群披露,使用的是阿里云(关联方)+ 集团内部分配的算力
  • 行业常见说法:“实际算力到位仅原计划1/4”——未在公开资料中确认,但与"国产芯片替代"的现实路径相符

反面观点

  • 用国产芯片训练 MoE 模型,“训练效果不输 H800” 是蚂蚁集团内部测试口径,没有第三方独立验证
  • DeepSeek V3/R1/V4 已经证明了"小规模算力 + 优秀算法"路径的可行性,蚂蚁百灵的"国产芯片+MoE"路线属于跟随,不是技术领先

1.5 团队规模与背景(公开口径)

已知

  • CEO 赵闻飙:上海交大+罗格斯大学双博士,2016 年加入蚂蚁,AI 安全/风控背景(科技行者
  • 蚂蚁数科员工规模:估算 3,000-5,000 人(未披露,行业估算)
  • “大模型技术创新部” 团队规模:未披露,行业估算"百人级别"(🔴 低置信度,仅供参考)
  • 百灵基模团队(属集团):核心团队来自阿里达摩院、清华、北大等,规模估算"千人级别"(🔴)

关键缺失

  • 蚂蚁数科未披露"大模型技术创新部"的具体技术领导
  • 未见数科自有的"AI 研究院"或"基模实验室"建制
  • 与百灵基模团队的"合作模式"具体如何(是否有 IP 共享、商业化分成、人员互调等)未公开

第二部分:基础大模型路线的成功可能性

2.1 支持成功的论据(🟢 看多)

2.1.1 母公司"百灵基模"积累,数科可以"借模"

  • 2026年2月13日:蚂蚁集团开源 Ring-2.5-1T,全球首个混合线性架构万亿参数思考模型(量子位
  • 2026年4月:Ling-2.6-1T 开源,万亿参数规模"对标 GPT-5.4"(蚂蚁内部口径,ITBear
  • 2026年2月11日:Ming-Flash-Omni 2.0 全模态模型开源,部分指标超 Gemini 2.5 Pro(InfoQ
  • 百灵家族已发布 18 款模型(2025-11 世界互联网大会披露),覆盖 10B 到 1T 全尺寸

含义:数科不需要从零训练基模,可以直接复用百灵开源 checkpoint + 自家金融数据微调,节省 80% 以上的预训练成本

2.1.2 金融数据+场景的独占性

  • 支付宝 + 网商银行 + 蚂蚁国际积累的金融行为数据规模国内罕有
  • 客户覆盖:100% 国有股份制银行 + 60%+ 地方性商业银行 + 1.3万 终端企业客户(36氪
  • Agentar-Fin-R1 训练数据:百亿级金融专业语料 + “6 大类、66 子类"金融任务分类体系,覆盖银行、证券、保险、基金、信托全景(搜狐

2.1.3 母公司持续输血

  • 蚂蚁集团 2024 净利 383 亿(+61%),2025Q2 净利 76 亿(+1.9倍)
  • 2025 胡润全球独角兽榜估值 6,350 亿 RMB(第5名)
  • 集团明确"加大对 AI ‘开创性贡献’激励力度”(韩歆毅 2026-02-02 全员信)

2.1.4 B端客户基础与灯塔案例

  • 宁波银行 × Agentar KBase新华网 2025-10):
    • 复杂问答准确率 68% → 91%
    • 响应速度进入百毫秒级
    • 内容推荐准确率 +35%、召回率 +40%
    • 入选"2025国际标准金融应用卓越案例"
  • 宁波银行票据识别(4/17 报告):错误率 0.8% → 0.05%,年减损 3,000 万
  • 金融、能源客户已投产应用百灵企业版方案腾讯新闻 2026-02

2.1.5 香港稳定币+RWA+Web3 叙事溢价

  • 蚂蚁数科 2025-04 在香港设海外总部
  • “两链一桥"已落地协鑫、朗新等 RWA 案例
  • :2026-04-10 香港首批稳定币牌照仅 2 张(汇丰+碇点),蚂蚁未入选——该叙事溢价已大幅折损新浪财经 2026-04-12

2.2 反对成功的论据(🔴 看空)

2.2.1 通用基模商品化加速

  • DeepSeek V4 开源(2026-04-24)观察者网21经济网):
    • V4-Flash 输入 1元/百万 tokens、输出 2元
    • 缓存命中输入仅 0.025元/百万 tokens(等于免费
    • 100万上下文成标配
    • “Agent 能力国内开源领先”——直接挤压数科 Agentar 的卖点
  • 千问 3.5(2026-02 春节)量子位 2026-02):
    • 397B 参数超越 Gemini 3
    • 百万 tokens 低至 8 毛
    • 2026-03 阿里巴巴 AI 品牌统一为"千问”——通用基模"国家队"地位强化

结论通用基模能力上,蚂蚁百灵 vs DeepSeek/千问没有明显技术领先——百灵的"万亿参数 MoE"和"国产芯片训练"在 2026 年已不是稀缺标签。

2.2.2 同集团内部竞争

  • 阿里通义(关联方):与蚂蚁数科同属阿里系,但通义在金融客户处直接售卖"千问+阿里云"捆绑方案,与数科形成内部竞争
  • 招商银行案例:招行选择通义大模型作为主合作伙伴(阿里云开发者),不是蚂蚁数科——这是关联方内部竞争的真实案例
  • 百灵基模属集团而非数科:蚂蚁集团旗下还有"阿福"、“灵光"两款 C 端 AI 应用消耗集团资源,数科在集团内的 AI 资源优先级未必高

2.2.3 算力到位与团队规模的不确定性

  • 蚂蚁数科未披露独立 GPU 集群,“自研大模型"严重依赖集团算力
  • “大模型技术创新部"团队规模未披露,估算百人级(🔴),相比 DeepSeek、千问、豆包的千人级团队有明显差距
  • 行业内部传言"实际算力到位仅原计划1/4”(来源未公开,🔴 低置信度)

2.2.4 “ToB 分拆型科技子公司"在中国市场无成功先例

  • 平安壹账通:2019 年 NYSE 上市,之后股价从 $10 跌至 $2 以下,2024 年退市
  • 京东数科:2020 年科创板撤回 IPO
  • 陆金所:2020 年 NYSE 上市,市值从峰值 470 亿美元跌至 50 亿美元以下
  • 结论:分拆型金融科技子公司在中港市场3战3败,蚂蚁数科要破局,需要找到与上述三家不同的差异化路径

2.2.5 金融客户决策权问题

  • 大行倾向自研:建设银行"方舟计划”(53AI)——选择"开源底座+金融数据微调”,2024 年底已适配 16 版本通用大模型,不依赖蚂蚁数科
  • 招商银行:“不搭建通用模型,而是搭建金融行业的领域模型”(STCN),选择通义+自研双轨
  • 中国银联:2026年4月私有化部署 DeepSeek-V4,基于华为昇腾算力(网易)——绕过所有商业大模型公司
  • 江苏银行:2025-02 首批本地化部署 DeepSeek-VL2 + DeepSeek-R1(每经

结论:金融客户的购买决策正在从"买大模型"转向"自己用开源底座+RAG+微调”。蚂蚁数科销售的不再是稀缺品。

2.2.6 BloombergGPT 的前车之鉴

  • 投入 $10M、500 亿参数金融垂直 LLM
  • GPT-4 发布两周后 几乎所有金融 benchmark 上 BloombergGPT 都被 GPT-4 超越(BelitsoftBeancount
  • 核心教训:“当前沿发展足够快时,规模比专业化更重要”
  • JPMorgan 选择:放弃自研基模,构建 LLM Suite 作为门户调用 OpenAICNBC 2024-08

2.3 概率判断

定义"成功":5 年内(2031)做出"被市场认可的基础大模型"——即在 ToB 金融客户的招标/采购中,蚂蚁数科自有大模型成为首选或第一备选,而非"必选项之一"。

路径定义5年内成功概率(估算)理由
自研通用基础大模型,与 DeepSeek/千问/豆包正面竞争<5%算力、人才、成本、生态全方位劣势;BloombergGPT 教训
基于百灵开源底座,做"金融垂直基模"成为细分领域 #130-40%Agentar-Fin-R1 已超 DeepSeek-R1(金融 benchmark),但客户决策权在变
智能体平台+长记忆+工具链组合 PMF(不直接卷基模)45-60%Agentar 已登顶 BIRD-SQL,信通院最高级别认证,宁波银行灯塔效应
IT 集成"配角",靠服务+数据+合规收费65-80%这是"金融级 IT 服务商"路径,恒生电子+宇信科技+神州信息已验证

综合判断

  • 严格意义上的"基础大模型路线成功"概率:<10%
  • 宽松意义上"AI 业务成功"概率:45-60%
  • 但宽松定义下的"成功",本质上数科是 “金融级 AI 服务商” 而非 “基础大模型公司”——这是关键的物种归类问题

第三部分:PMF 分析

3.1 先定义"成功的 PMF"

路径定义成功 PMF 标志概率(估算)
路径A:自研 LLM 成为客户首选(与千问/豆包正面竞争)蚂蚁百灵/Agentar 基模在通用 benchmark 上长期领先国内/全球 ToB 模型市占率 >10%,定价权稳定<5%
路径B:垂直金融大模型成为细分领域第一Agentar-Fin-R1 类模型在金融benchmark + 真实生产环境双双第一国内 Top10 金融机构有 >5 家用 Agentar 作首选金融模型30-40%
路径C:智能体+长记忆+工具链组合 PMF(不直接卷基模)Agentar 平台成为金融客户 Agent 开发的事实标准国股行+城商行 50%+ 选 Agentar 作首选 Agent 平台50-65%
路径D:模型做成 IT 集成"配角",靠服务+数据收费大模型只是技术工具,营收主要来自咨询+实施+数据服务类似恒生电子模式,第三方营收稳定 50亿+,毛利率 30%+70-85%

3.2 PMF 信号验证(已落地客户案例)

客户/场景落地形态量化效果来源真实 PMF 信号?
宁波银行 × Agentar KBase知识工程+逻辑推理准确率 68%→91%;推荐准确率 +35%;召回率 +40%新华网🟢 强
宁波银行 × Agentar-Fin-R1票据识别错误率 0.8%→0.05%,年减损 3,000万4/17报告🟢 强
工商银行客服智能体通话时长 -10%,坐席效率 +18%电子银行网🟡 中(非数科独家)
协鑫能科RWA代币化1亿 RMB 跨境融资4/17报告🟡 中(与基模关系弱)
哈萨克斯坦 BCC 银行海外金融科技出海标杆4/17报告🟡 中
金融、能源客户 × 百灵企业版私有化部署未披露具体客户名+收入腾讯新闻 2026-02🔴 弱(黑箱)

关键观察

  • 已披露的灯塔案例集中在 “宁波银行+几个能源/政务客户”,规模有限
  • 国股行 100% 覆盖的口径是"客户名单覆盖"而非"AI 大模型采购首选"——这是关键的口径错配
  • 工商银行、建设银行、招商银行等大行的大模型主合作伙伴不是蚂蚁数科

3.3 反向 PMF 信号

3.3.1 BIRD-SQL benchmark 第一 ≠ 商业 PMF

  • 2025-12 Agentar-Scale-SQL 登顶 BIRD-SQL,准确率 92%(量子位
  • :BIRD-SQL 是学术 benchmark,与商业付费意愿之间的桥梁未被数据验证
  • 类比:BloombergGPT 在 FinEval 上当时也是 SOTA,仍然商业化失败

3.3.2 金融客户购买决策机制

  • 合规优先:央行、银保监对金融 AI 的"自主可控"要求极强 → 大行倾向自建
  • 建设银行方舟53AI):“选择万亿参数开源通用大模型,通过预训练、微调、强化学习自建”,2024 年底已适配 16 版本——不需要蚂蚁数科
  • 招商银行 × 通义:招行直接与阿里云合作,使用通义大模型作为基础,自研行业层(阿里云开发者)——蚂蚁数科被绕开

3.3.3 中小行付费能力受限

  • DeepSeek V4 价格:百万 tokens 输入 0.025元(缓存命中)——中小行直接调用 API 即可,没有付费意愿购买"金融垂直基模"
  • 江苏银行首批本地化部署 DeepSeek-VL2 + DeepSeek-R1——已建立完整方法论
  • 中国银联私有化部署 DeepSeek-V4 + 华为昇腾——国产开源底座已经成熟

3.3.4 行业大模型替代率有限

  • 行业共识新浪 2026):“不再追求’万能模型’,而是采用’开源基座 + 私有数据微调 + RAG 增强’的主流落地路径,使用成本降至通用大模型的 1/5 左右”
  • 这意味着客户不需要"金融垂直基模"作为单独产品,而是需要**“开源底座 + 微调工具 + RAG + Agent 工具链 + 服务”** 的整体方案

反向结论:客户的真正痛点不在"基模能力"层,而在"工具链+部署+合规+服务"层。

3.4 PMF 综合判断

维度当前实际状态理想 PMF 状态Gap
客户付费意愿灯塔案例 5-10 个Top 30 金融机构付费比例 >50%
ACV(年合同价值)估算 500万-2,000万/客户(🟡)5,000万-1亿/大行
客户留存率未披露>90%数据缺失
扩盘率(NRR)未披露>120%数据缺失
按效果付费占比未披露>30%数据缺失
第三方收入占比60-70%(估算)>70%接近
客户对开源平替的偏好在上升应在下降趋势不利

结论

  • **路径 D(IT 集成"配角")**已基本验证 PMF——这是数科现实的主营业务
  • **路径 C(Agent 平台)**有早期 PMF 信号,但还不稳定,仍面临 DeepSeek V4 + 千问 3.5 的开源 Agent 工具链竞争
  • **路径 B(金融垂直基模)**仍在追求 PMF,但被"大行自建"和"开源平替"双向挤压,PMF 可能性正在收窄而非扩大
  • **路径 A(自研通用 LLM)**没有现实可行性

第四部分:差异化价值分析

4.1 对标矩阵:蚂蚁数科 vs 通用基模厂商

维度千问(Qwen)豆包(Doubao)DeepSeek智谱(GLM)文心(ERNIE)Kimi蚂蚁数科数科差异化方向
基模能力★★★★★★★★★★★★★★★★★★★★★★★★★★★★★(依赖百灵)🔴 劣势
算力规模★★★★★(阿里云)★★★★★(火山)★★★★(自有+租)★★★★★★★★★★★★★★★(共享集团)🔴 劣势
开源生态★★★★★★★★(部分)★★★★★★★★★★★★★★★★(百灵开源但生态弱)🔴 劣势
价格竞争力★★★★★(百万0.8元)★★★★★★★★★★(百万0.025元)★★★★★★★★★★★★(溢价定价)🔴 劣势
金融数据壁垒★★(公开+合作)★★★★★★★★★★★★★★★★(蚂蚁系独占)🟢 优势
金融 know-how★★★★★★★★★★★★★★★★★(深耕14年金融)🟢 优势
合规/牌照★★★★★★★★★★★★★★★★★★★★★★★★(信通院最高级别+金融级合规)🟢 优势
私有化部署能力★★★★★★★★★★★★★★★★★★★★★★★★★★(蚂蚁链+mPaaS+SOFAStack 闭环)🟢 优势
Agent 平台★★★★(百炼)★★★★(扣子)★★★★★★★★★★★★★★★★★(Agentar 登顶BIRD)🟢 优势但快速被追赶
客户决策权客户自主调用客户自主调用客户自主调用客户自主调用客户自主调用客户自主调用数科捆绑销售🔴 风险

4.2 真正可能的差异化(“真差异化”)

4.2.1 金融场景理解 × 数据壁垒 × 合规护栏

这是数科唯一有壁垒的差异化叙事,本质是:

通用基模厂商:
"我有最好的模型,自己拼装"
   ↓
客户:买的是技术工具

蚂蚁数科:
"我有最懂金融的模型 + 行业 know-how + 私有部署 + 审计闭环 + 出问题我兜底"
   ↓
客户:买的是合规风险转移的服务

关键证据

  • Agentar-Fin-R1 在 FinEval 1.0、FinanceIQ 上确实领先 DeepSeek-R1(搜狐
  • 中国信通院最高级别认证(“金融科技应用风险通用要求”
  • “6 大类、66 子类"金融任务分类体系(行业内最完整)
  • 母公司 14 年金融业务积累:支付、信贷、风控、反欺诈

4.2.2 私有化部署 + 蚂蚁链 + 隐私计算闭环

  • 摩斯隐私计算市占 36.9%(第一)
  • 蚂蚁链 BaaS 市占 24.4%(连续 4 年第一)
  • 加上百灵企业版(2026 即将推出)
  • 闭环能力:从模型到部署到链上审计到隐私保护,单一供应商可交付

4.2.3 “AI 兜底"的服务承诺

  • 灯塔案例的"按效果付费"模式(如宁波银行年减损 3,000 万分成)
  • 这是通用基模厂商不愿也不能承诺的——千问、DeepSeek、豆包都是"模型卖出去就完事”

4.3 真正不能的差异化(“伪差异化”)

4.3.1 单纯的基模能力(必输)

  • DeepSeek V4 (2026-04)、千问 3.5 (2026-02)、豆包均已在通用 benchmark 上超越或接近 Gemini/GPT-4
  • 蚂蚁百灵 Ling-2.6-1T “对标 GPT-5.4” 是集团内部口径,未见独立 benchmark 验证全面领先
  • BloombergGPT 教训证明:“专业化"打不过"规模”

4.3.2 单纯的算力规模

  • 蚂蚁集团总算力 vs 阿里云、字节、腾讯——全方位劣势
  • 即使百灵团队全力投入,与通义+阿里云的合并能力相比,蚂蚁数科可调用算力只是子集

4.3.3 单纯的开源生态

  • DeepSeek 开源生态:全球 GitHub Star 数十万级,社区活跃度极高
  • 千问 Qwen:阿里云全球开发者社区+魔搭社区双轮驱动
  • 蚂蚁百灵开源(Ling/Ring/Ming):发布时间晚,社区规模和用户基础显著小于 DeepSeek/Qwen

4.4 差异化价值核心论断

类别内容客户付费意愿维持期
真差异化(3件事)1. 金融场景 know-how(深度)
2. 合规级数据壁垒(专属)
3. 私有部署+审计闭环(兜底)
🟢 高3-5年
伪差异化(不能比)1. 通用基模能力
2. 算力规模
🔴 无
正在收窄的差异化1. Agent 平台先发优势(DeepSeek V4、Qwen 都在追赶)🟡 中1-2年

结论:数科的差异化故事确实存在,但它不是"基础大模型"层的差异化,而是 “金融行业专家系统” 层的差异化。这与"做基础大模型"的叙事有根本不同


第五部分:可比公司参照

5.1 BloombergGPT:金融垂直 LLM 的全球第一案例

维度数据对蚂蚁数科的启示
投入$10M(约 7,000万 RMB)数科投入预计 5-10 亿 RMB(百灵+数科合计),数量级类似
模型规模500 亿参数数科基于 Qwen3 微调(32B/72B),更小
训练数据363B 金融 token + 345B 通用Agentar-Fin-R1 训练数据规模未披露,估计相当
与 GPT-4 对比GPT-4 几乎所有金融 benchmark 都超越 BloombergGPT警告:基础前沿模型迭代速度 > 垂直模型差距
商业化结果基本没有外部商业化,仅 Bloomberg 内部使用强警告:投入产出比可能极低
当前状态团队解散/转型,BBG 改用 LLM Suite 架构路径警告

来源:arXiv 2303.17564BelitsoftBeancount

5.2 JPMorgan LLM Suite:北美大行的现实选择

维度数据
投入未公开,但没有自研基模
架构“门户型 LLM Suite”,调用 OpenAI、Anthropic 等外部模型
部署规模60,000+ 员工使用(2024 年)
关键策略通过技术手段保护内部数据,让数据不外流即可
启示大型金融机构的优选不是"自研垂直基模”,而是"门户+数据保护"

来源:CNBC 2024-08Business Standard

5.3 恒生电子 LightGPT:中国金融 IT 龙头的尝试

维度数据
发布时间2023-06 / 2023-10 升级
训练数据4,000亿+ token 金融数据
应用场景投研报告、研报洞察、财报处理
商业化嵌入恒生原有"光子"系列产品
估值含义恒生电子市值约 500-600 亿(2026-04),LightGPT 没有给恒生带来明显估值溢价
启示金融垂直大模型对市值贡献有限,真正贡献的是"AI+原有金融 IT 软件"的复合

来源:hs.net/lightgpt同花顺 600570

5.4 平安 PinganGPT:保险+银行的金融大模型

维度数据
架构L0(基础通用)/ L1(行业模型)/ L2(场景模型)三层
应用规模100+ 大模型应用场景;AI 外呼 550+ 用例,44 亿次调用
商业化方向几乎完全内部使用,对外 ToB 输出有限
启示平安选择"内化",蚂蚁数科选择"对外"——后者难度更大

来源:36氪平安银行

5.5 招商银行 + 通义大模型:中国大行的合作模式范本

维度数据
模式招行 × 阿里通义合作,不是与蚂蚁数科
结果智能客服准确率 >95%,日处理 100 万对话,替代 3,000 客服
自研策略“不搭建通用模型,而是搭建金融行业领域模型”
自有产品“一招"开源金融大模型
启示招行案例直接说明:通义在金融客户处与蚂蚁数科正面竞争,且通义胜出

来源:阿里云开发者STCN

5.6 建设银行方舟计划:大行自研路径的代表

  • 2023-03 启动方舟计划
  • 选择"开源底座 + 金融数据 + 自研"路径
  • 至 2024 年底适配 16 个版本通用大模型
  • 已落地 193 个应用场景,仅 7 大核心能力
  • 完全不依赖蚂蚁数科

来源:53AI移动支付网

5.7 全球"金融垂直大模型"路径成功率统计

案例路径商业化结果成功?
BloombergGPT自研 50B 参数金融模型基本失败,被 GPT-4 超越
JPMorgan LLM Suite调用 OpenAI 的"门户”内部 6万员工使用
招商银行"一招"自研开源金融模型内部使用为主🟡
建设银行方舟开源底座+自研适配193 场景落地
平安 PinganGPTL0/L1/L2 三层自建100+ 场景内化
恒生电子 LightGPT金融 IT 龙头延伸嵌入原有产品,估值贡献有限🟡
蚂蚁数科 AgentarToB 售卖金融大模型+Agent灯塔案例 5-10 个

统计结论

  • “自建+内部使用"路径成功率 ~70%(JPM、CCB、平安)
  • “对外 ToB 售卖金融垂直基模"路径成功率 <30%(BloombergGPT 失败、恒生估值贡献有限)
  • 蚂蚁数科选的是更难的路径

第六部分:综合判断(三个核心问题的明确答案)

6.1 蚂蚁数科基础大模型路线的成功概率

定义"成功”:5 年内(2031 之前)做出"被市场认可的基础大模型”——意味着在 ToB 客户的招标/采购中,数科自有大模型成为首选或第一备选,营收贡献 >30%,并支撑公司估值溢价。

子路径5年内概率(估算)说明
严格意义"基础大模型公司"路线<10%通用基模商品化已成定局,BloombergGPT 已是反例
“百灵+Agentar+金融垂直微调"组合路线40-55%已有的灯塔案例支撑,但被开源平替和大行自建夹击
“AI 服务公司"路线(路径D)65-80%最现实路径,但天花板低,估值难超 1,000亿

核心判断

数科要"成功”,必须放弃"基础大模型公司"的叙事,承认自己是 “金融级 AI 服务+合规+部署"的综合服务商。

6.2 找到 PMF 的概率(分四条路径)

路径PMF 概率(估算)关键证据风险
路径A:自研通用 LLM 与千问/豆包正面竞争<5%算力、人才、生态全面落后BloombergGPT 教训
路径B:垂直金融基模成为细分领域第一30-40%Agentar-Fin-R1 在多个金融 benchmark 超 DeepSeek-R1大行自建+开源平替双向挤压
路径C:智能体+长记忆+工具链组合50-65%Agentar 登顶 BIRD-SQL;信通院最高认证;宁波银行案例DeepSeek V4 Agent 能力快速追赶
路径D:模型作"配角”+服务+数据收费70-85%路径已被恒生/宇信验证;蚂蚁数科客户基础+合规背书天然适合天花板低,估值上限受限

6.3 差异化价值的明确答案

真差异化(3 件事)

  1. 金融行业的深度 know-how——14 年蚂蚁系金融业务沉淀,“6 大类 66 子类"金融任务分类体系是最完整的
  2. 合规级数据壁垒——支付、信贷、风控行为数据规模国内罕有
  3. 私有部署+审计+蚂蚁链+隐私计算的闭环——单一供应商完整交付能力,是开源厂商不能模仿的

伪差异化(2 件事)

  1. 基模技术领先——通用基模商品化下,蚂蚁百灵 vs DeepSeek/千问/豆包技术上已无本质差距,“万亿参数 MoE+混合线性架构"在 2026 年不是稀缺技术
  2. 算力规模或开源生态规模——数科可调用的算力是阿里云的子集,开源生态是 DeepSeek/Qwen 的子集,两个维度都是绝对劣势

6.4 一句话总结(给非专业读者)

蚂蚁数科真正能赢的不是"做出更强的大模型”,而是"做成金融行业的’AI 安心管家’"——把开源基模当原料、把金融场景理解当配方、把合规审计当包装、把私有部署当物流,最后客户为’安心’付溢价,而不是为"模型本身"付溢价。如果他们坚持把自己定位为"基础大模型公司”,5 年内有 70% 概率失败;如果他们承认自己是"金融级 AI 服务公司”,5 年内有 60% 概率成功——但估值天花板可能只有 800-1,500 亿 RMB,而不是市场流传的 2,000 亿+。


第七部分:风险与监控指标

7.1 关键风险(按严重程度)

#风险严重度当前概率影响
1DeepSeek/千问 Agent 能力快速追赶——Agentar 的"BIRD 第一"被 6-12 个月内超越🔴 极高60-70%Agent 平台差异化时间窗口短
2大行集体选择"开源底座+自建"路径——招行+建行已先行🔴 极高50-60%ToB 大客户流失
3百灵团队优先级不在数科 ToB——集团 AI 资源向阿福(健康)+灵光(C端)倾斜🟠 高40-50%数科"借模"通道不畅
4金融垂直 benchmark 第一不转化为商业 PMF(BloombergGPT 教训)🟠 高40-50%投入产出比不达预期
5关联交易披露后第三方收入大幅缩水🟠 高30-40%估值打折
6国产芯片训练效果未达内部口径——独立 benchmark 验证不通过🟡 中20-30%算力成本上行
7“按效果付费"模式难以规模化——单客户案例无法批量复制🟡 中30-40%商业模式天花板
8BloombergGPT 式的"投入大、商业化失败”🟡 中20-30%资源浪费
9阿里通义在金融客户处持续替代蚂蚁数科(招行案例已发生)🟡 中50-60%集团内部竞争输
10监管对 Web3/RWA 收紧(4/10 香港稳定币首批未含蚂蚁)🟡 中已发生部分期权价值折损

7.2 季度监控指标

指标频率关键阈值
Agentar 客户数(新增+留存)季度新增 >20/季度,留存 >85%
第三方收入占比半年是否突破 70%
按效果付费收入占比半年是否突破 20%
百灵开源模型 GitHub Star 增速月度vs DeepSeek/Qwen 比值
Agentar 在 BIRD-SQL 等 benchmark 排名季度是否被 DeepSeek/Qwen 超越
国股行+城商行使用蚂蚁数科 AI 作首选的比例半年与建行+招行+工行的内部份额对比
招行/建行/工行 AI 主合作伙伴变化实时是否有从通义/自建转向蚂蚁数科的迹象
数科"大模型技术创新部"团队规模半年是否达到 200 人级别
集团 AI Credit 激励授予数科员工的比例年度vs 阿福、灵光、百灵的分配
蚂蚁集团 AI 总投入分配年度数科 / C端AI(阿福+灵光)/ 百灵基模的分配比例

附录 A:关键数据汇总

A.1 蚂蚁集团 AI 资产盘点(2026/04)

资产归属状态关键数据
百灵基模家族蚂蚁集团开源18+ 模型,Ling/Ring/Ming 系列,10B 至 1T 全尺寸
Ling-2.6-1T蚂蚁集团开源“对标 GPT-5.4”(内部口径,2026-04)
Ring-2.5-1T蚂蚁集团开源全球首个混合线性架构万亿思考模型(2026-02)
Ming-Flash-Omni 2.0蚂蚁集团开源全模态,部分指标超 Gemini 2.5 Pro(2026-02)
Agentar-Fin-R1蚂蚁数科商用+部分开源基于 Qwen3,金融 benchmark 超 DeepSeek-R1(2025-07)
Agentar-Scale-SQL蚂蚁数科开源登顶 BIRD-SQL,92% 准确率(2025-12)
Agentar 智能体平台蚂蚁数科商用信通院最高级别认证(2025-10)
百灵企业版蚂蚁数科待发布2026-02-19 宣布即将推出
阿福 AI 应用蚂蚁集团商用月活 3,000 万+,春节用户破亿(C端健康)
灵光 AI 应用蚂蚁集团商用C 端 AI 应用周活榜第10位(2026-02)

A.2 金融大模型市场关键玩家(2026/04)

玩家模型/产品性质蚂蚁数科可比性
阿里通义(关联方)Qwen3-Max / Qwen 3.5通用基模+ToB关联方但内部竞争
字节豆包Doubao通用基模+ToB直接对手
DeepSeekV4-Pro / V4-Flash通用基模+开源价格屠夫,最大威胁
智谱GLM 系列通用基模+ToB+IPO直接对手
百度文心ERNIE 4.5通用基模+ToB直接对手
华为盘古盘古 5通用+信创政企信创主战场
KimiKimi 系列通用 ToC+ToB间接
招商银行一招自建+开源客户被通义抢走
建设银行方舟自建+16版本不依赖蚂蚁数科
平安PinganGPT自建内化内部竞争(非客户)
恒生电子LightGPT金融 IT 厂商直接对手(证券领域)
中国银联私有部署 DeepSeek-V4自建+开源不依赖蚂蚁数科
蚂蚁数科Agentar-Fin-R1 + 百灵企业版ToB 金融垂直

附录 B:Sources(数据来源清单)

本报告引用了 30+ 公开 URL,按主题分类如下。

B.1 蚂蚁数科大模型战略与公司公告

  1. 蚂蚁数科 CEO 赵闻飙发全员信,宣布将成立"大模型技术创新部"(新浪科技 2026-02-04)
  2. 蚂蚁数科全员信:将成立大模型技术创新部(OFweek 2026-02)
  3. 蚂蚁 CEO 韩歆毅发布全员信:AI 探索未到庆功时刻(观察者 2026-02-03)
  4. 蚂蚁集团 CEO 韩歆毅发内部信:加大对 AI"开创性贡献"激励力度(每经 2026-02-02)
  5. 蚂蚁集团 AI 业务月活超 3000 万,支付用户破 1 亿(经济观察网 2026-03-01)
  6. 蚂蚁数科将发布百灵大模型企业版(腾讯新闻 2026-02-20)

B.2 蚂蚁百灵基模与开源进展

  1. 蚂蚁集团开源 Ring-2.5-1T,全球首个混合线性架构万亿参数思考模型(量子位 2026-02-13)
  2. 蚂蚁百灵 Ling-2.6-1T 正式开源:万亿参数规模对标 GPT-5.4(ITBear 2026-04)
  3. 蚂蚁集团开源全模态大模型 Ming-Flash-Omni 2.0(新浪科技 2026-02-11)
  4. 从多模态走向全模态!蚂蚁开源 Ming-Flash-Omni 2.0,对标 Gemini 2.5 Pro(InfoQ 2026-02)
  5. 蚂蚁集团采用国产 AI 芯片训练大模型,将计算成本降低约 20%(OSCHINA 2025-03)
  6. 蚂蚁集团 AI 重大突破:使用国产 AI 芯片训练大模型,成本可进一步降低(新浪财经 2025-03-25)

B.3 Agentar-Fin-R1 与 Agentar 智能体平台

  1. 蚂蚁数科发布金融推理大模型 助力金融机构加速落地智能体应用(STCN 2025-07)
  2. 蚂蚁推出首个金融推理大模型,登顶权威金融测评,超越 OpenAI o1、DeepSeek-R1(新浪财经 2025-07-28)
  3. 蚂蚁数科宣布开源数据分析智能体技术 当前登顶 BIRD(新浪科技 2025-12-15)
  4. 蚂蚁数科宣布开源数据分析智能体技术,当前登顶 BIRD(量子位 2025-12)
  5. 蚂蚁数科 Agentar 入选 2025 国际标准金融应用卓越案例(新华网 2025-10-30)
  6. 打造企业级智能体开发平台标杆,蚂蚁数科 Agentar 通过中国信通院最高级别认证(江苏网 2025-10)
  7. 2026 主流企业智能体开发平台选型指南:综合优选蚂蚁数科 Agentar(IT 之家 2026-04)
  8. 金融大模型的"垂直突围":蚂蚁数科打造更懂金融的行业大脑(腾讯新闻 2025-07)

B.4 通用基模厂商竞争(DeepSeek/Qwen/豆包)

  1. DeepSeek V4,再当一次"价格屠夫"?(观察者 2026-04-24)
  2. DeepSeek 推动 AI"价格战":百万 Token 输入 0.25 元(21 经济网 2026-04-26)
  3. 最强开源大模型除夕登场!397B 参数千问 3.5 超越 Gemini 3,百万 Tokens 低至 8 毛(量子位 2026-02)
  4. 阿里巴巴 AI 品牌统一为"千问"(21 经济网 2026-03-02)
  5. 破解金融 AI 落地难题,中国银联率先私有化部署 DeepSeek-V4 大模型(网易 2026-04)
  6. Deepseek 有望引发银行大模型应用变革(每经 2025-02-05)

B.5 全球与国内金融大模型对标

  1. BloombergGPT: A Large Language Model for Finance(arXiv 2303.17564)
  2. BloombergGPT and the Limits of Domain-Specific LLMs in Finance(Beancount 2026-05)
  3. JPMorgan Chase Unveils AI-Powered LLM Suite(Business Standard 2024-07)
  4. JPMorgan giving its employees an AI assistant powered by ChatGPT maker OpenAI(CNBC 2024-08)
  5. 恒生电子 LightGPT 官网(hs.net)
  6. 建设银行金融大模型建设和应用实践(53AI 2025-06)
  7. 招商银行 X 通义大模型,2024 年度 AI 最佳实践案例(阿里云开发者 2025-01)
  8. 对话招商银行俞吴杰:招行重点不在搭建通用模型,而是搭建金融行业的领域模型(STCN)
  9. 六大国有银行正在落地哪些大模型应用场景(53AI 2024-08)
  10. 14 家银行 AI 战略蝶变:从"AI+金融"到"人+AI" 超百个应用已落地(STCN)

B.6 行业与 PMF 分析

  1. 2026 大模型深度解析:泡沫退去,价值落地才是核心战场(新浪 2026)
  2. 别再死磕 PMF 了!AgaaS 时代,中国 To B 创业者的最后一张船票(53AI 2026-03)
  3. 深度 | GenAI 时代的 PMF(53AI 2024-06)
  4. 企业落地大模型的路径、场景与案例(爱分析)

B.7 其他

  1. 中企加速 AI 服务出海 蚂蚁数科在马来西亚设立运营枢纽中心(新浪财经 2026-02-26)
  2. 蚂蚁数科 AItoB 加速出海 在马来西亚设立运营枢纽中心(36 氪 2026)
  3. 香港发放首批稳定币牌照,三家发钞行两家获批(新浪财经 2026-04-12)
  4. 蚂蚁数科上线 LingDT-2.6-flash,进一步为企业提供实用型 AI 工具(Chinaz 2026-04-29)
  5. 蚂蚁数科 LingDT-2.6-flash 上线:Token 高效利用,助力企业 AI 规模化应用降本增效(ITBear 2026-04)

附录 A:LingDT-2.6-flash 事实修正(2026-04-30 update)

背景:本报告主体完成于 2026-04-30 上午。当天补做事实核查,发现遗漏了蚂蚁数科 2026-04-29 发布的新模型 LingDT-2.6-flash。本附录对原报告中"数科本身不做基础大模型预训练 / 只做集团基模的 ToB 转售"这一表述做出部分修正

A.1 LingDT-2.6-flash 关键事实

维度数据来源
发布主体蚂蚁数科(2026-04-29)Chinaz
命名含义“DT” = Digital Technology,数科自有商业化产品线标识ITBear
总参数104B(MoE 架构)同上
激活参数7.4B同上
基础来源基于蚂蚁集团百灵团队的 Ling-2.6-flash 做商业化版本(非从零自研)“全面承袭了 Ling-2.6-flash 的核心优势”
数科增量工作(1) 底层架构优化,Token 消耗节省高达 90%;(2) 金融级安全防护体系;(3) 私有化部署+数据隔离+API 权限管控;(4) DTMaaS 商业化平台同上
定价输入 0.48元/百万 tokens;输出 1.44元/百万 tokens(限时8折)同上
应用领域金融、能源、交通;金融已落地超百个智能体(AI手机银行、保险理赔、安全封控、财富管理)同上

A.2 对原报告核心论点的影响

原报告论点LingDT 信息核对后状态
“数科本身不做基础大模型预训练依然成立——LingDT 是 Ling-2.6-flash 的商业版,不是从零预训练
“数科是集团基模成果的 ToB 商业化通道 + 行业垂直层封装印证而非颠覆——LingDT 正是"商业化通道"的具象产品
“数科只是’转售’集团基模”(隐含表达)⚠️ 部分修正——数科确实做了底层架构层面的 Token 效率优化、金融安全重训、企业部署能力,是有实质增量的商业化封装,不是简单转售
“通用基模能力是伪差异化”依然成立——但 Token 效率优化 应被识别为第三条真差异化(在原报告"金融场景 know-how + 合规闭环"之外)

A.3 价格信号的解读

LingDT 定价(输入 0.48 元/百万 tokens)的横向对比:

模型输入价格(元/百万 tokens)vs LingDT
DeepSeek V40.025LingDT 贵 19 倍
Qwen 3.50.8LingDT 便宜 40%
集团 Ling-2.6(开源)0(开源自部署)LingDT 提供托管溢价
LingDT-2.6-flash0.48

信号:LingDT 选择"中端价格+金融安全溢价"定位,避开与 DeepSeek 的价格战,同时压制通用基模 API 的成本。这印证了原报告"金融级 AI 服务商而非基模公司"的判断——靠服务(合规+部署+优化)收溢价,不靠模型能力本身

A.4 新增的"真差异化"维度

原报告的差异化分类:

类型维度
真差异化金融场景 know-how、合规级数据壁垒、私有部署+审计闭环
伪差异化基模能力、算力规模、开源生态

修正后新增第四条真差异化

企业级 Token 效率优化(如 LingDT 的 90% Token 节省)—— 真差异化

理由:

  • B 端客户对 TCO(总拥有成本)极度敏感,不像 C 端只看绝对能力
  • 90% Token 节省直接对应实际部署成本下降数倍,这是真痛点
  • 通用基模厂商优化方向是绝对能力(cross-benchmark),不是 token 效率
  • 这是数科把"金融场景 know-how"反向影响"模型架构"的具象产物——是一种有壁垒的工程能力

A.5 对三个核心问题答案的影响

问题原结论修正后
Q1 5年内做出"被市场认可的基础大模型"通用<10% / 垂直40-55%通用<10% / 垂直 45-60%(轻微上调,因 LingDT 落地已证明商业化路径走通早期)
Q2 找到 PMF自研LLM<5% / 垂直30-40% / Agent 50-65% / 服务化 70-85%整体上调5pp——LingDT 的"Token 效率定位"+ 落地超百个金融智能体显示路径可行
Q3 真差异化金融场景+合规+审计闭环 3 条新增第 4 条:企业级 Token 效率优化

A.6 修正后的"一句话总结"

修正前:数科要做"基础大模型"成功的真路径不是与 DeepSeek/Qwen/豆包正面卷通用基模能力,而是把母公司百灵开源底座 + 自家金融场景数据 + Agent 平台 + 合规与审计闭环做成一个对金融、能源、政务客户而言"开箱即用、合规放心"的行业级 AI 基础设施——本质上是高毛利的 AI 服务公司,而不是基础大模型公司。

修正后:数科要做"基础大模型"成功的真路径是接收集团百灵的开源底座,叠加四件实质增量——金融场景 know-how、企业级 Token 效率优化(如 LingDT 的 90% 节省)、合规与审计闭环、DTMaaS 商业化平台基建——做成对企业客户而言"开箱即用、合规放心、TCO 可控"的金融级 AI 服务。这是高毛利 AI 服务公司,不是基础大模型公司,但也不是简单转售集团基模——LingDT 证明了数科在 商业化封装层 是有真实工程能力增量的。


报告元数据

  • 研究日期:2026-04-30
  • 研究方式:单角色"AI 产业分析师"深度分析(基于 4/17 团队报告 + 4/28 估值聚焦报告 + 13 次 Web 搜索)
  • 总字数:约 8,500 字(含 4/30 update 附录)
  • 数据置信度:🟡 中(关键技术指标依赖蚂蚁内部口径,部分客户案例数据未独立验证)
  • 报告原则:客观、不预设立场、正反两面、数据标注来源、估算明确标注
  • 报告边界:纯公开信息分析,不含任何内部视角,不涉及任何个人隐私
  • 修订记录:2026-04-30 追加附录A(LingDT-2.6-flash 事实修正),对原报告"数科是简单转售"的隐含表达做修正
  • 基线研究

基于公开信息独立分析,不构成任何投资建议