LTX-2 是 Lightricks 推出的 19B 参数联合音视频扩散 Transformer(DiT)基础模型,
能够从文本或图像提示生成时间同步的视频与音频。本交付在昇腾 NPU(逻辑 npu:0)
上运行 LTX-2 的核心生成链路:LTX2VideoTransformer3DModel(48 层,19B)+ 视频
VAE(AutoencoderKLLTX2Video),并附带音频 VAE、vocoder 与 tokenizer 子模块。
由于 40 GiB 磁盘预算限制,完整仓库中的 Gemma3-27B 文本编码器(约 48.7 GB)不在
交付子集内,推理脚本采用固定种子的合成文本嵌入(caption_channels=3840)执行
直接 transformer + VAE 前向。
torch 与 torch_npu:由固定 worker 镜像提供(版本与 CANN 配套)requirements.txt(精确版本锁定)source /usr/local/Ascend/ascend-toolkit/set_env.sh
export ASCEND_RT_VISIBLE_DEVICES=0
pip install -r requirements.txtmodel-repo/ 内为真实权重(已校验 SHA-256,非 LFS 指针)。python inference.pynpu:0 上执行一次前向,输出以下设备标记:INPUT_DEVICE=npu:0
MODEL_DEVICE=npu:0
OUTPUT_DEVICE=npu:0
CPU_FALLBACK=false
EXIT_CODE=0EXIT_CODE=0 表示运行成功。脚本仅使用逻辑 npu:0,不读取或修改
ASCEND_RT_VISIBLE_DEVICES,且禁止 CPU 回退。
[1, 128, F, H, W] 与 [1, 3, F*8, H*32, W*32]。latent_tensors)与离散输出(generated_media)。raw_timings_ms 与
npu-smi 快照。INPUT_DEVICE=npu:0、MODEL_DEVICE=npu:0、OUTPUT_DEVICE=npu:0、
CPU_FALLBACK=false。latent_tensors(transformer 视频潜在输出)与 generated_media
(VAE 解码视频张量),均为逻辑 npu:0 上的真实前向结果。assets/agent_workflow.png:迁移 Agent 工作流截图。assets/npu_device_call.png:NPU 设备调用截图。assets/model_result.png:模型运行结果截图。已完成 10 个可信样本和四组精度候选复验。即使对同一 CPU latent 仅在 NPU 执行 VAE 解码,离散一致率最高约为 0.9968,仍低于官方 1.0 门槛;该残差来自 CPU oneDNN 与 Ascend NPU bf16 内核的累积顺序差异。仓库保留完整实现和证据,当前不声明精度 PASSED,后续优化交由开源社区继续跟进。
以下图片由真实 Model Agent 对话记录、npu-smi 设备日志和最终 NPU 推理日志
以无头浏览器渲染生成;每张 PNG 均有同名 .provenance.json,记录源证据哈希。


