物理AI的ChatGPT时刻?NVIDIA Cosmos开源世界模型来了

· 科技资讯

引言

当ChatGPT横空出世时,全世界都意识到大语言模型已经学会了”理解”文字。但一个更尖锐的问题随之而来:机器何时才能真正”理解”物理世界? 当一台机器人伸手抓取水杯,它需要的不是漂亮的句子,而是对重力、摩擦力、物体形变的精确建模。让AI学会理解物理世界的因果规律——这恰恰是整个行业最棘手的难题。而NVIDIA刚刚扔出了一枚重磅炸弹:Cosmos——一个面向物理AI的开放世界模型平台,正以开源之姿引爆GitHub Trending。

物理AI的ChatGPT时刻?NVIDIA Cosmos开源世界模型来了封面

什么是物理AI?

物理AI(Physical AI)与传统AI最大的区别在于,它不是在数字空间中处理文本或图片,而是直接与真实物理世界交互。机器人抓取、自动驾驶避障、智能工厂调度——这些场景的共同特征是:每一次决策都伴随着真实的物理后果。一个错误的预测不仅意味着准确率下降一个百分点,更可能导致碰撞、损坏甚至人员伤亡。

这也解释了为什么物理AI发展远慢于语言AI。训练一个能识别猫的模型,你只需要大量图片;训练一个能安全驾驶的模型,你需要在千百万种极端场景中采集数据——而这些场景在真实世界中极难复现。

Cosmos:为物理世界而生的大模型

NVIDIA Cosmos是一套世界基础模型(World Foundation Models, WFM)平台,专门为物理AI开发者打造。它不只是单一模型,而是一整个开源生态系统,包含预训练模型、数据处理流水线、训练框架和评估工具。

最新发布的Cosmos 3采用统一的混合Transformer(Mixture-of-Transformers, MoT)架构,将推理与生成能力合二为一:

Reasoner(推理器):接收文本与视觉输入,输出文本推理结果。它擅长理解视频中的物体交互、预测动作后果,并支持链式推理(chain-of-thought),可广泛应用于具身智能体的任务规划与决策。

Generator(生成器):接收文本、图像、视频、声音和动作序列,生成对应的高保真视频、环境音频与动作轨迹,实现”世界生成→世界仿真→未来预测→合成数据生成”的完整闭环。

这种设计使Cosmos 3成为全球首个全开源的全模态全能模型(Omnimodel)——它原生理解并生成文字、图像、视频、环境声音与动作,真正做到了多模态感知与行动的一体化。

模型家族:从边缘到云端

Cosmos 3提供两档主力模型:

| 模型 | 参数量 | 定位 |

|——|——–|——|

| Cosmos3-Nano | 160亿 | 紧凑型全模态世界模型,兼顾理解、仿真、预测和动作推理 |

| Cosmos3-Super | 640亿 | 前沿级全模态世界模型,面向最复杂的物理AI场景 |

另有Cosmos3-Super-Text2Image(高保真文生图)、Cosmos3-Super-Image2Video(时序一致性图生视频)、Cosmos3-Nano-Policy-DROID(机器人操控策略模型)等专项变体,覆盖从256p到720p多种分辨率,支持16:9、4:3、1:1等常见宽高比,帧率在10到30 FPS之间灵活可调。

值得关注的是,NVIDIA还预告了Cosmos3 Edge——专为边缘设备实时推理而优化的版本,这意味着未来机器人和自动驾驶系统有望在本地端侧运行这些世界模型。

支撑这一切的”数据工厂”

任何大模型的根基都是数据。Cosmos的训练数据规模令人咋舌:超过2000万小时的真实世界视频,涵盖人类交互、工业场景、机器人操作和驾驶数据,总计训练了9000万亿个token。NVIDIA为此构建了一套端到端的数据处理与标注流水线(基于NeMo Curator),在Hopper GPU上处理这批数据需要40天,而在最新的Blackwell GPU上仅需14天——如果用未经优化的CPU方案,这个数字是:超过三年。

Cosmos的Tokenizer同样值得单独一提:总压缩率比现有先进方案高8倍,处理速度快12倍。这不仅大幅降低了训练与推理的计算成本,也为端侧部署打开了可能性。

生态全景:不止于模型

Cosmos远非一个模型仓库那么简单,它是一整套围绕物理AI构建的开源工具体系:

Cosmos Predict:世界预测模型,根据文本/图像/视频输入生成未来世界状态的视频,支持多帧生成与中间动作轨迹预测。

Cosmos Transfer:世界到世界的迁移模型,能将仿真环境中的结构化输入(深度图、分割图、LiDAR等)转换为照片级真实感的视频输出,桥接仿真与现实的鸿沟。

Cosmos Reason:一个开源、可定制的物理推理VLM,具备时空理解与链式推理能力,既可独立使用,也可作为其他WFM的文本编码器。

Cosmos RL:专门为物理AI场景设计的灵活强化学习框架。

Cosmos Curator & Evaluator:数据管理与模型评估工具链。

配合NVIDIA Omniverse的3D仿真能力,Cosmos还能实现”多元宇宙仿真”——让AI策略模型在虚拟环境中探索每一条可能的未来路径,从而选出最优解。

谁在用Cosmos?

从人形机器人到自动驾驶,行业头部玩家已纷纷入局:1X用Cosmos训练其NEO Gamma人形机器人;Agility Robotics用它为Digit机器人生成大规模合成训练数据;Figure AISkild AIUberWaabiForetellix等公司也在自动驾驶与机器人领域深度采用。NVIDIA还联合Agile Robots、Black Forest Labs、Runway、LTX等机构成立了Cosmos Coalition,共同推动下一代世界模型的发展。

为什么这件事如此重要?

物理AI长期受困于”数据饥渴”——真实世界的物理交互数据获取成本极高、周期漫长。Cosmos通过开放世界模型,让开发者能够在虚拟世界中无限次地仿真、试错和优化,将物理AI的训练与评估周期从数月压缩至数天

如果说大语言模型教会了AI”说话”,那么Cosmos这类世界基础模型正在教会AI”行动”。当机器能够真正理解重力、碰撞、形变这些物理概念,机器人和自动驾驶等物理AI应用才算真正从实验室走向现实。NVIDIA选择将其完全开源,无疑将加速整个行业的演进——物理AI的ChatGPT时刻,或许已经到来


参考链接:[GitHub – NVIDIA/Cosmos](https://github.com/NVIDIA/cosmos) · [NVIDIA Cosmos 官方页面](https://www.nvidia.com/en-us/ai/cosmos)


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

滚动至顶部
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅