DeepSeek 的「双面时刻」:一边拿下中国 AI 最大融资,一边刷新全球最快训练纪录

· 科技资讯
DeepSeek 双面时刻

2026年6月17日 | LC智趣厅


六月的 DeepSeek 同时在两条战线宣告了它的存在感。

一面是资本。6月16日,多家媒体确认 DeepSeek 已完成首轮融资,募资超 70 亿美元(约合人民币 500 亿元),估值最高达 590 亿美元——这是中国 AI 行业迄今最大的一笔单轮融资。

另一面是算力。几乎同一时间,NVIDIA 公布了 MLPerf Training 6.0 基准测试结果:在 CoreWeave 的 Blackwell 集群上,DeepSeek-V3 671B 模型以 2.02 分钟完成训练,刷新该赛道的全球最快纪录,比上一代平台提速 60%。

钱和技术,同时炸场。这在中国 AI 的叙事里,还从没同时发生过。


一、70 亿美元买一张船票

这不是一轮普通的融资。

结构就很不寻常。 梁文锋个人出资约 200 亿元人民币,占本轮总规模近四成。腾讯出资约 100 亿元,宁德时代出资约 50 亿元,网易和京东也参与了洽谈。整个投资阵容不超过 10 家。

更不寻常的是控制权设计。 据报道,外部投资者仅享有经济权益,没有投票权。梁文锋通过与国家人工智能产业投资基金关联的有限合伙企业,在吸纳天量资金的同时保持了对公司的绝对话语权。

> $70 亿 — 本轮融资总额

> $590 亿 — 投后最高估值

> 200 亿 — 梁文锋个人出资

> 100 亿 — 腾讯出资

> 50 亿 — 宁德时代出资

> < 10 家 — 投资方阵容

这个结构背后的逻辑是什么?梁文锋从幻方量化时代就以「不融资、不商业化、不路演」著称。他曾经多次拒绝外部资本,担心投资人干预战略决策。

但现在游戏的规则变了。

大模型竞赛已进入「三个月迭代」的节奏。阿里明确未来 AI 投入将远超 3800 亿元,字节跳动上修资本开支至 2000 亿元。封闭式运营在指数级增长的算力需求面前,根本撑不住。

梁文锋的选择是:要钱,但不要意见。

控制权架构

二、为什么是腾讯和宁德时代?

这两大巨头的入局,不是简单地「看好 DeepSeek」。

腾讯的焦虑在于 AI 入口。 腾讯有混元大模型,但在国内市场的竞争中明显落后于字节跳动的豆包和阿里的千问。一季度腾讯 AI 资本开支已达 319 亿元,但这笔 100 亿的投资或许比自研投入更高效——直接在模型层卡位,用 DeepSeek 的技术补上短板。

宁德时代的算盘是「算电协同」。 这家全球最大动力电池厂商近两个月动作频频:收购 HVDC 龙头中恒电气,收购 IDC 运营商世纪互联,完成了从供电设备到数据中心运营的全链条布局。入股 DeepSeek,意味着宁德时代在算力消耗端找到了一个超级客户——这盘棋,从「发电」一直下到「用算力」。

三方利益关系

三、2.02 分钟:一场算力军备竞赛的缩影

融资的故事讲的是「未来」,MLPerf 的数据讲的是「现在」。

NVIDIA Blackwell 平台在 MLPerf Training 6.0 全部 7 项基准测试中拿下最快成绩。最引人注目的是 DeepSeek-V3 671B 的训练表现:

> 在 CoreWeave 的 8,192 张 GB300 NVL72 GPU 集群上,仅用 2.02 分钟就达到质量目标。 相比之下,同规模的 GB200 NVL72 需要更长时间——GB300 实现了高达 1.6 倍的加速。

> 8,192 — GPU 数量

> 2.02 分钟 — DeepSeek-V3 训练时间

> 60% — 相比上代提速

> 7 项全制霸 — Blackwell 覆盖全部基准

> 19 家 — 提交结果的组织数

这几个数字说明了什么?

第一,NVLink 的带宽优势正在转化为碾压级的训练效率。 72 张 GPU 通过第五代 NVLink Switch 连成一个统一的 GPU 内存池——这不再是「很多张 GPU 一起跑」,而是一台巨大的 GPU。

第二,NVFP4 低精度训练的成熟,让大模型训练的性价比曲线大幅下移。 NVIDIA 展示了在保持严格精度标准下,用更低精度完成训练和微调——包括自家 5500 亿参数的 Nemotron 3 Ultra。

第三,也是最重要的:DeepSeek 已经是 NVIDIA 用来秀肌肉的标杆客户。 在 MLPerf 的舞台上,用你的模型来证明我的芯片最强——双方的利益已经深度绑定。


四、从「不融资」到「最大融资」:一个时代的转折

往回看,DeepSeek 的路径在 AI 行业里几乎是反常识的。

2023 年发布 DeepSeek-V2 时靠的是幻方量化的利润。2024 年凭 DeepSeek-R1 引爆全球,靠的是极致性价比——百万 Token 推理成本打到了 2.5 分钱。那时候的梁文锋,是「不需要融资」的旗帜。

那为什么现在融了?而且一融就是 70 亿美元?

答案藏在两层逻辑里:

表层逻辑:算力吃紧。 671B 参数的模型,推理已经需要几千张 GPU。如果下一目标是万亿参数——更别提多模态、视频生成——算力缺口是数量级的。

深层逻辑:窗口期在关闭。 国内阿里、字节、腾讯都在 all-in,美国有 OpenAI、Anthropic、Google。模型能力的差距一旦拉开,用性价比追不回来。「不融资」的代价不是慢一点,而是被淘汰。

所以梁文锋做了他最擅长的事:用数学的方式解决战略问题。 如果融资不可避免,那就设计一个让资本出钱但不出声的结构。200 亿个人资金是这局棋里最关键的一手——它既是对外宣告「我跟你们一起赌」,也是对内确保「船还是我的」。

DeepSeek 时间线

五、这对中国 AI 意味着什么?

先说结论:DeepSeek 的这轮融资,标志中国 AI 进入了「军备竞赛 2.0」阶段。

1.0 阶段拼的是模型能力——谁的评测分数高,谁的 token 便宜。DeepSeek 在 1.0 阶段赢了。

2.0 阶段拼的是资本厚度 + 算力规模 + 生态卡位。阿里 3800 亿、字节 2000 亿、腾讯 319 亿(仅 Q1)——现在 DeepSeek 一口吞下 500 亿元人民币,直接把自己推上了牌桌。

但这张船票不便宜。 590 亿美元的估值意味着——市场对 DeepSeek 的预期已经不是一个「开源模型公司」,而是一个需要跟 OpenAI(估值 3000 亿+)对标的平台级玩家。

另一个不容忽视的信号:本次融资的投资方没有一家是纯财务投资者。 腾讯有流量和云,宁德时代有电力和基础设施,网易有游戏和内容,京东有电商和物流——每一家都是带着场景来的。这不是「给钱让你花」,而是「给钱让我用」。

资本对比

中国 AI 的下半场,格局正在收束到少数几个超级玩家手上。DeepSeek 用一张 70 亿美元的支票,确保了自己在那张桌子上有座位。


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

滚动至顶部
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅