NVIDIA Cosmos开源:物理AI的GPT时刻已至

· 科技资讯

大语言模型有GPT,物理AI的”GPT时刻”是什么?

如果大语言模型的开源奠定了生成式AI的繁荣,那么物理世界模型的开源,会不会是具身智能爆发的同款引信?NVIDIA用Cosmos给出了一个不容忽视的回答。

NVIDIA Cosmos开源:物理AI的GPT时刻已至封面

2025年CES上,NVIDIA发布了Cosmos世界基础模型平台。2026年COMPUTEX,黄仁勋亲自站台宣布Cosmos 3全面开源——一个集推理、生成、仿真于一体的全模态物理AI模型,直接上了GitHub和Hugging Face。

> “世界基础模型之于物理AI,就如同大语言模型之于聊天机器人。”

Cosmos用9000万亿个token训练,素材来自2000万小时的真实世界视频——涵盖驾驶、机器人操作、工业场景和自然环境。

拆解Cosmos:它为什么重要

Cosmos 3的架构叫混合专家Transformer(Mixture-of-Transformers):推理模块理解物理世界,生成模块创造物理世界。

推理模式下,它能看懂视频里的物体交互、运动轨迹和行为意图,支持最长25.6万个token的上下文,做空间定位和链式推理。

生成模式下,它能从文字、图片、视频甚至动作序列出发,生成物理上合理的未来世界视频——最高720p、最长300帧、30FPS。不只生成画面,声音、动作轨迹、摄像头路径同步输出。

模型家族俩量级:Nano(160亿参数)跑边缘推理,Super(640亿参数)做前沿训练。另有一个杀手锏:Tokenizer压缩效率是业内最佳方法的8倍,推理速度则快了12倍,算力门槛被大幅压低。

谁在受益

Uber用它做自动驾驶数据增强;Waabi嵌入生成式仿真器做AV训练;1X、Agility Robotics、Figure AI在人形机器人策略学习中用Cosmos生成合成数据;丰田研究院、通用汽车、XPENG均在官方合作伙伴名单上——超过40家顶级企业

对于创业公司,意义更大。过去训练机器人抓取模型需要几百小时真实视频。现在用Cosmos从几个起始帧出发,就能生成无穷变体场景。这是数据瓶颈的解药

开源背后的战略棋盘

物理AI是比语言模型更难啃的市场:数据获取成本极高、仿真到现实的鸿沟始终存在。

Cosmos开源的真正意图,是让世界模型成为新一代计算基础设施的底座。就像CUDA当年用免费生态锁定开发者,Cosmos通过开放模型、数据管线、微调框架,把物理AI生态绑在NVIDIA的GPU战车上。

黄仁勋在COMPUTEX上说得很直白:”物理AI的规模将是语言模型的百倍以上。”回想开源LLM如何催生整个AI应用生态——从Llama到DeepSeek,具身智能站在同一条起跑线上。Cosmos开源,可能是这条赛道最关键的一次发令枪。

窗口期与隐忧

世界模型离完美还很远。Cosmos生成的长时间视频仍可能出现物理不一致——物体突然消失、重力不稳、碰撞错误。对于安全攸关场景,直接用生成数据训练需要极其审慎的验证。

OpenMDW-1.1许可证虽允许商业使用,但具体条款仍需企业法务仔细审查。”无限制开源”和”有条件开放”之间还有灰色地带。

但方向明确。当世界模型能从视频中学会重力、摩擦力、动量守恒——那就不仅是仿真工具的升级,而是AI理解世界方式的范式转移。

护城河正在被填平

NVIDIA开源Cosmos,相当于在说:物理AI的底层能力不应该封闭在少数实验室里。

对中国开发者而言,全球开源生态正把世界模型变成”基础水电”——谁先接入,谁就能以更低成本训练具身智能。如果观望,等到所有人都用上同样的基础设施,先发窗口也就关闭了。

物理世界的ChatGPT还没出现,但它的地基已经铺好了。


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

滚动至顶部
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅