atlasleong/ltx-2-npu
模型介绍
文件和版本
Pull Requests
讨论
分析

LTX-2 昇腾 NPU 推理交付

模型简介

LTX-2 是 Lightricks 推出的 19B 参数联合音视频扩散 Transformer(DiT)基础模型, 能够从文本或图像提示生成时间同步的视频与音频。本交付在昇腾 NPU(逻辑 npu:0) 上运行 LTX-2 的核心生成链路:LTX2VideoTransformer3DModel(48 层,19B)+ 视频 VAE(AutoencoderKLLTX2Video),并附带音频 VAE、vocoder 与 tokenizer 子模块。 由于 40 GiB 磁盘预算限制,完整仓库中的 Gemma3-27B 文本编码器(约 48.7 GB)不在 交付子集内,推理脚本采用固定种子的合成文本嵌入(caption_channels=3840)执行 直接 transformer + VAE 前向。

环境依赖

  • 硬件:Ascend 910 系列(至少 1 卡)
  • 操作系统:openEuler / Ubuntu(aarch64 或 x86_64)
  • CANN ≥ 8.0(本环境使用 8.5.1)
  • Python 3.8 – 3.11
  • torch 与 torch_npu:由固定 worker 镜像提供(版本与 CANN 配套)
  • 其他 Python 依赖:见 requirements.txt(精确版本锁定)
source /usr/local/Ascend/ascend-toolkit/set_env.sh
export ASCEND_RT_VISIBLE_DEVICES=0
pip install -r requirements.txt

分步推理

  1. 进入交付目录,确认 model-repo/ 内为真实权重(已校验 SHA-256,非 LFS 指针)。
  2. 运行推理脚本:
python inference.py
  1. 脚本在逻辑 npu:0 上执行一次前向,输出以下设备标记:
INPUT_DEVICE=npu:0
MODEL_DEVICE=npu:0
OUTPUT_DEVICE=npu:0
CPU_FALLBACK=false
EXIT_CODE=0

EXIT_CODE=0 表示运行成功。脚本仅使用逻辑 npu:0,不读取或修改 ASCEND_RT_VISIBLE_DEVICES,且禁止 CPU 回退。

测试用例

  • 用例一:单样本直接前向。固定随机种子(seed=42),输入为合成视频 / 音频潜在变量 与合成文本嵌入,输出 transformer 视频潜在张量与 VAE 解码视频张量,形状分别为 [1, 128, F, H, W] 与 [1, 3, F*8, H*32, W*32]。
  • 用例二:多样本回归。多进程逐样本执行 CPU 参照与 NPU 前向,保存 CPU/NPU 数组与 NPU 张量检查点,比较连续输出(latent_tensors)与离散输出(generated_media)。
  • 用例三:性能采集。warmup 1 次 + 同步计时 5 次,记录 raw_timings_ms 与 npu-smi 快照。

输出结果

  • 设备标记:INPUT_DEVICE=npu:0、MODEL_DEVICE=npu:0、OUTPUT_DEVICE=npu:0、 CPU_FALLBACK=false。
  • 产物:latent_tensors(transformer 视频潜在输出)与 generated_media (VAE 解码视频张量),均为逻辑 npu:0 上的真实前向结果。
  • 截图说明(由可信截图器在真实验证后生成,本阶段仅占位引用,不创建图片):
    • assets/agent_workflow.png:迁移 Agent 工作流截图。
    • assets/npu_device_call.png:NPU 设备调用截图。
    • assets/model_result.png:模型运行结果截图。

原模型仓库

  • 原仓库地址:https://ai.gitcode.com/hf_mirrors/Lightricks/LTX-2
  • 固定版本:dfcc2108383fe1aaa0584bdf55d368a4bdadd90c

精度限制与社区跟进

已完成 10 个可信样本和四组精度候选复验。即使对同一 CPU latent 仅在 NPU 执行 VAE 解码,离散一致率最高约为 0.9968,仍低于官方 1.0 门槛;该残差来自 CPU oneDNN 与 Ascend NPU bf16 内核的累积顺序差异。仓库保留完整实现和证据,当前不声明精度 PASSED,后续优化交由开源社区继续跟进。

Agent 使用截图

以下图片由真实 Model Agent 对话记录、npu-smi 设备日志和最终 NPU 推理日志 以无头浏览器渲染生成;每张 PNG 均有同名 .provenance.json,记录源证据哈希。

Model Agent 完整适配工作流

Model Agent 完整适配工作流

昇腾 NPU 设备调用

昇腾 NPU 设备调用

模型最终适配验收结果

模型最终适配验收结果