HuggingFace镜像/Cosmos-Predict2-2B-Video2World
模型介绍
文件和版本
分析

Cosmos-Predict2:提供 2B 与 14B 规格的基于扩散的世界基础模型套件

Cosmos | Code | Website

模型概览

描述

Cosmos-Predict2:一个高性能的预训练世界基础模型家族,专为面向物理 AI 开发而打造,可生成具备物理感知能力的图像、视频和世界状态。

Cosmos-Predict2 扩散模型是一组基于扩散的世界基础模型,可根据文本、图像或视频输入生成动态、高质量的图像和视频。它可作为与世界生成相关的应用或研究的基础组件。上述模型可在 NVIDIA Open Model 许可协议下用于商业用途。

模型开发者:NVIDIA

模型版本

Cosmos-Predict2 基于扩散的模型家族包括以下模型:

  • Cosmos-Predict2-2B-Text2Image
    • 给定一段文本描述,预测输出图像。
  • Cosmos-Predict2-14B-Text2Image
    • 给定一段文本描述,预测输出图像。
  • Cosmos-Predict2-2B-Video2World
    • 给定一段文本描述和一张作为首帧的图像,预测未来帧。
    • 该模型提供六个变体,以支持不同使用场景:
      • 生成 720P、16FPS 视频的变体(这是默认模型)
      • 生成 720P、10FPS 视频的变体
      • 生成 480P、16FPS 视频的变体
      • 生成 480P、10FPS 视频的变体
      • 生成 720P、16FPS 视频 + NATTEN 的变体(稀疏注意力变体)
      • 生成 720P、10FPS 视频 + NATTEN 的变体(稀疏注意力变体)
  • Cosmos-Predict2-14B-Video2World
    • 给定一段文本描述和一张作为首帧的图像,预测未来帧。
    • 该模型提供六个变体,以支持不同使用场景:
      • 生成 720P、16FPS 视频的变体(这是默认模型)
      • 生成 720P、10FPS 视频的变体
      • 生成 480P、16FPS 视频的变体
      • 生成 480P、10FPS 视频的变体
      • 生成 720P、16FPS 视频 + NATTEN 的变体(稀疏注意力变体)
      • 生成 720P、10FPS 视频 + NATTEN 的变体(稀疏注意力变体)
  • Cosmos-Predict2-14B-Video2World-Sample-GR00T-Dreams-GR1:
    • 基于视频 + 文本的未来视觉世界生成,并在 GR00T GR1 数据上进行后训练
  • Cosmos-Predict2-14B-Video2World-Sample-GR00T-Dreams-DROID:
    • 基于视频 + 文本的未来视觉世界生成,并在 GR00T DROID 数据上进行后训练
  • Cosmos-Predict2-2B-Action-Conditioned-Sample
    • 给定一张作为首帧的图像以及接下来 12 个动作,预测未来 12 帧。

许可证

该模型依据 NVIDIA Open Model License 发布。如需定制许可证,请联系 cosmos-license@nvidia.com。

根据 NVIDIA Open Model License,NVIDIA 确认:

  • 模型可商用。
  • 您可以自由创建并分发衍生模型。
  • NVIDIA 不主张对使用模型或衍生模型生成的任何输出拥有所有权。

重要提示:如果您规避、禁用、削弱或绕开模型中包含的任何技术限制、安全护栏或相关安全护栏超参数、加密、安全、数字版权管理或身份验证机制,您依据 NVIDIA Open Model License Agreement 享有的权利将自动终止。

部署地域

全球

模型架构

Cosmos-Predict2-2B-Video2World 是一种扩散 Transformer 模型,专为在潜在空间中进行视频去噪而设计。该网络以交替排列的自注意力层、交叉注意力层和前馈层作为基本构建模块。交叉注意力层使模型能够在整个去噪过程中以输入文本为条件。在每一层之前,都会应用自适应层归一化,以注入去噪所需的时间信息。当提供图像或视频作为输入时,其潜在帧会沿时间维度与生成帧进行拼接。向条件潜在帧中添加了增广噪声,以弥合训练与推理之间的差距。

输入/输出规格

  • 输入

    • 输入类型:文本+图像、文本+视频
    • 输入格式:
      • 文本:字符串
      • 图像:jpg、png、jpeg、webp
      • 视频:mp4
    • 输入参数:
      • 文本:一维(1D)
      • 图像:二维(2D)
      • 视频:三维(3D)
    • 与输入相关的其他属性:
      • 输入字符串应少于 300 个单词,并应提供用于世界生成的描述性内容,例如场景描述、关键物体或角色、背景,以及在 5 秒时长内需要描绘的任何特定动作或运动。
      • 对于 720P 模型,输入图像应为 1280×704;对于 480P 模型,请使用 832×480。
      • 输入视频应由 5 帧组成,每帧在 720P 模型中的分辨率为 1280×704,或在 480P 模型中为 832×480。
  • 输出

    • 输出类型:视频
    • 输出格式:mp4
    • 输出参数:三维(3D)
    • 与输出相关的其他属性:生成的视频为 5 秒片段,其分辨率和帧率由所使用的模型变体决定。例如,720P 16FPS 模型生成的视频分辨率为 1280×704,帧率为 16 FPS。

视频内容会将输入的文本描述可视化为一段短动画场景,并在指定的时间约束内呈现关键元素。

我们的 AI 模型经过设计和/或优化,可在 NVIDIA GPU 加速系统上运行。通过利用 NVIDIA 的硬件(例如 GPU 核心)和软件框架(例如 CUDA 库),该模型相较于仅使用 CPU 的解决方案,可实现更快的训练和推理速度。

软件集成

运行时引擎:

  • Cosmos-Predict2
  • Diffusers
import torch
from diffusers import Cosmos2VideoToWorldPipeline
from diffusers.utils import export_to_video, load_image

# Available checkpoints: nvidia/Cosmos-Predict2-2B-Video2World, nvidia/Cosmos-Predict2-14B-Video2World
model_id = "nvidia/Cosmos-Predict2-2B-Video2World"
pipe = Cosmos2VideoToWorldPipeline.from_pretrained(model_id, torch_dtype=torch.bfloat16)
pipe.to("cuda")

prompt = "A close-up shot captures a vibrant yellow scrubber vigorously working on a grimy plate, its bristles moving in circular motions to lift stubborn grease and food residue. The dish, once covered in remnants of a hearty meal, gradually reveals its original glossy surface. Suds form and bubble around the scrubber, creating a satisfying visual of cleanliness in progress. The sound of scrubbing fills the air, accompanied by the gentle clinking of the dish against the sink. As the scrubber continues its task, the dish transforms, gleaming under the bright kitchen lights, symbolizing the triumph of cleanliness over mess."
negative_prompt = "The video captures a series of frames showing ugly scenes, static with no motion, motion blur, over-saturation, shaky footage, low resolution, grainy texture, pixelated images, poorly lit areas, underexposed and overexposed scenes, poor color balance, washed out colors, choppy sequences, jerky movements, low frame rate, artifacting, color banding, unnatural transitions, outdated special effects, fake elements, unconvincing visuals, poorly edited content, jump cuts, visual noise, and flickering. Overall, the video is of poor quality."
image = load_image(
    "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/diffusers/yellow-scrubber.png"
)

video = pipe(
    image=image, prompt=prompt, negative_prompt=negative_prompt, generator=torch.Generator().manual_seed(1)
).frames[0]
export_to_video(video, "output.mp4", fps=16)

支持的硬件微架构兼容性:

  • NVIDIA Ampere
  • NVIDIA Blackwell
  • NVIDIA Hopper

说明:仅测试了 BF16 精度。FP16 或 FP32 等其他精度未获官方支持。

推理

加速引擎:PyTorch, Transformer Engine

操作系统:

  • Linux(我们未在其他操作系统上进行测试。)

系统要求与性能: 该模型需要 32.54 GB 的 GPU 显存。 下表列出了在不同 NVIDIA GPU 硬件上单次生成的推理时间:

GPU 硬件480p, 10 FPS480p, 16 FPS720p, 10 FPS720p, 16 FPS720p, 10 FPS + NATTEN720p, 16 FPS + NATTEN
H100 SXM25.3 s45.5 s115.1 s228.8 s56 s94.2 s
H200 SXM24 s43.7 s111.1 s221.7 s52.9 s89.4 s
B20014.3 s25.5 s62.4 s123.9 s32.6 s54 s
H100 NVL34.1 s66.4 s175.5 s355.7 s79 s138.7 s
H100 PCIe39.5 s73.7 s187.9 s378.5 s87.4 s149.6 s
H200 NVL27.2 s51.4 s133.1 s267.2 s60.7 s104.3 s
L40S256.2 s480.9 s1281.1 s2567.1 s--
RTX PRO 6000 Blackwell44.6 s84.7 s223.1 s452.2 s--

质量基准: 为便于对比评估,我们展示基于 PBench 的基准得分。

模型PBench 综合得分PBench 领域得分PBench 质量得分
LTX-Video74.077.270.8
HunyuanVideo-I2V74.077.470.6
CogVideoX-5B-I2V74.279.569.0
Wan2.1-I2V-14B-720P75.881.969.7
Cosmos-Predict1-7B-Video2World73.277.469.0
Cosmos-Predict1-14B-Video2World73.377.669.0
Cosmos-Predict2-2B-Video2World77.284.869.6
Cosmos-Predict2-14B-Video2World77.484.969.9

注意:上表中的 Cosmos-Predict2 数值均为默认变体(720p、16FPS、无稀疏性)。

所有 Predict2 变体对应的 PBench 得分请参考下表:

模型PBench 综合得分PBench 领域得分PBench 质量得分
Cosmos-Predict2-2B, 480p, 10 fps76.884.369.2
Cosmos-Predict2-2B, 480p, 16 fps76.583.669.5
Cosmos-Predict2-2B, 720p, 10 fps76.584.168.9
Cosmos-Predict2-2B, 720p, 16 fps77.284.869.6
Cosmos-Predict2-2B, 720p, 10 fps + NATTEN76.383.669.0
Cosmos-Predict2-2B, 720p, 16 fps + NATTEN77.084.569.5
Cosmos-Predict2-14B, 480p, 10 fps77.084.269.7
Cosmos-Predict2-14B, 480p, 16 fps77.084.070.0
Cosmos-Predict2-14B, 720p, 10 fps77.385.069.6
Cosmos-Predict2-14B, 720p, 16 fps77.484.969.9
Cosmos-Predict2-14B, 720p, 10 fps + NATTEN76.784.169.4
Cosmos-Predict2-14B, 720p, 16 fps + NATTEN77.084.269.9

使用方法

  • 有关详细信息,请参见 Cosmos-Predict2。

局限性

尽管面向物理 AI 的世界生成能力已取得多方面改进,Cosmos-Predict2 的 video2world 模型在世界预测方面仍面临技术与应用层面的局限。尤其是在生成无伪影的长时长、高分辨率视频方面仍显吃力。常见问题包括时间不一致性、相机与物体运动不稳定,以及交互不够精确。这些模型在生成视频中可能无法准确表征三维空间、四维时空或物理规律,从而产生伪影,例如物体消失或变形、交互不真实、运动不合理。因此,将这些模型用于需要模拟基于物理规律的环境或复杂多智能体动态的应用场景,仍然具有挑战性。

伦理考量

NVIDIA 认为可信 AI 是一项共同责任,并制定了相应的政策与实践,以支持各类 AI 应用的发展。在下载或按照我们的服务条款使用时,开发者应与内部模型团队协作,确保该模型满足相关行业和用例的要求,并应对未预见的产品误用问题。

用户需对模型的输入和输出负责。用户有责任确保该模型得到安全集成,包括在部署前实施护栏以及其他安全机制。

如需了解本模型伦理考量的更详细信息,请参见下方关于可解释性、偏见、安全与保障、隐私的子卡片。请通过此处报告安全漏洞或 NVIDIA AI 关切事项。

Plus Plus(++)承诺

我们珍视您,珍视这些数据,珍视它们所代表的多样性,也珍视我们所受托承担的责任。该模型及其相关数据已做到:

  • 经核验,符合当前适用的披露法律、法规和行业标准。
  • 经核验,符合适用的隐私标注要求。
  • 已添加标注,说明数据收集方/来源(NVIDIA 或第三方)。
  • 已进行技术局限性描述。
  • 已审查,确保相关披露可被访问、持续维护,并符合 NVIDIA 数据主体及其请求的合规要求。
  • 发布前已经审查。
  • 已标注已知限制及潜在安全影响。

偏差

字段响应
模型设计与测试中来自受不利影响群体 受保护类别 的参与考量:无
为缓解不良偏差所采取的措施:无

可解释性

字段响应
预期应用与领域:世界生成
模型类型:Transformer
预期用户:物理 AI 开发者
输出:视频
模型工作原理:根据视频输入生成视频
技术局限性:模型可能无法准确遵循视频输入。
已验证符合 NVIDIA 既定质量标准:是
性能指标:定量与定性评估
潜在已知风险:模型输出可生成各类视频,包括可能被视为有害、冒犯或不雅的视频。
许可证:NVIDIA Open Model License

隐私

字段响应
可生成或可逆向工程得到的个人信息?暂无已知
创建该模型时是否使用了受保护类别数据?暂无已知
是否就所使用的任何个人数据获得了同意?暂无已知
数据集多久审查一次?发布前
用于训练的所有数据集是否均具备来源可溯性?是
数据标注(注释、元数据)是否符合隐私法律法规?是
如数据主体提出更正或删除数据的请求,数据是否已符合此类请求?不适用
适用的隐私政策https://www.nvidia.com/en-us/about-nvidia/privacy-policy/

安全

字段响应
模型应用场景:世界生成
请描述其对生命安全的关键影响(如有)。暂无已知
使用场景限制:NVIDIA Open Model License
模型与数据集限制:已应用最小权限原则(PoLP),以限制数据集生成与模型开发的访问权限。相关限制措施会约束训练期间的数据集访问,并遵守数据集许可约束。模型检查点已在 Hugging Face 上提供,未来也可能在云服务商的模型目录中提供。