JD OpenSource/JoyAI-Echo
模型介绍文件和版本Pull Requests讨论分析
下载使用量0

JoyAI-Echo generated video gallery

JoyAI-Echo

🎬 探索长视频生成的全新边界

用于分钟级多镜头音视频生成的官方模型权重,具备蒸馏DMD生成器、配对跨模态记忆及故事级一致性。

仅供学术研究和非商业用途。

📄 技术报告 | 🌐 项目主页 | 💻 推理代码 | 🧬 模型 | 🚀 使用方法 | 📊 结果展示 | 📝 引用方式

Text-to-Video Audio + Video 5 minute long video Model Weights

模型概述

JoyAI-Echo 是一个长时长、多镜头、音视频生成框架,旨在突破长视频生成中存在的误差累积、时间连贯性弱以及推理延迟过高等瓶颈。跨模态视听记忆库能够在五分钟的视频中保持角色外观和语音音色的一致性,而结合基于记忆的强化学习与分布匹配蒸馏(DMD)的训练后处理流程,则实现了7.5倍的推理速度提升,同时保证了生成质量。

在长视频生成任务上,JoyAI-Echo 显著优于 HappyOyster(导演模式),在以人为中心的任务上甚至超越了短视频生成专家 Wan 2.6。

本仓库包含已发布的模型 checkpoint。推理代码将单独发布,请参见使用方法部分。

模型详情

  • 开发团队: 京东 Joy Future Academy Echo 团队
  • 模型类型: 文本到(音频+视频)扩散 transformer,DMD 8 步
  • 模态: 文本 → 同步视频 + 音频
  • 基础架构: 基于 LTX-Video 构建
  • 文本编码器: google/gemma-3-12b-it(需单独下载)
  • 默认分辨率/长度: 1280 × 736,每段镜头 241 帧 @ 25 fps
  • 最大故事长度: 长达 5 分钟(多镜头)
  • 许可证: LTX-2 社区许可协议

主要亮点

  • 🎞️ 分钟级多镜头故事:通过一个提示 JSON 生成连贯的镜头序列。
  • ⚡ DMD 蒸馏少步推理:比原始 pipeline 快约 7.5 倍。
  • 🔊 音视频联合生成:单一 pipeline 产出同步的视频和音频。
  • 🧠 配对跨模态记忆库:为每个新镜头提供先前的视觉身份和语音上下文条件,确保故事级一致性。

演示案例库

在 项目页面 上探索 JoyAI-Echo 的长视频和短视频案例。🍿

使用方法

推理通过独立的 JoyAI-Echo 推理仓库运行。

1. 下载检查点

huggingface-cli download jdopensource/JoyAI-Echo \
  --local-dir checkpoints

同时下载 Gemma 文本编码器:

huggingface-cli download google/gemma-3-12b-it \
  --local-dir checkpoints/gemma-3-12b

预期布局:

checkpoints/
├── echo-longvideo-release.safetensors
└── gemma-3-12b/

2. 获取推理代码

git clone https://github.com/jd-opensource/JoyAI-Echo.git
cd JoyAI-Echo

环境要求:Python 3.11 + PyTorch 2.8 + CUDA 12.8(详见推理仓库的 environment.yml / requirements.txt 文件)。

3. 编写故事提示词

请先优化您的提示词。 我们提供了提示词优化器——即系统提示词,可将简短的故事或创意扩展为结构完善的镜头提示词:prompts/long_story_writer_system_prompt.md 适用于长篇多镜头视频,prompts/short_story_writer_system_prompt.md 适用于单镜头短视频。我们强烈建议在推理前通过匹配的优化器处理您的输入;未经优化的提示词往往会导致明显较差的结果。

在 prompts/ 目录下创建一个 JSON 文件。每个文件为单个对象,包含一个 prompts 列表,其中每个字符串代表一个完整的镜头。单个字符串生成一个镜头;多个字符串则生成一个多镜头故事,每个新镜头会通过配对的音视频记忆库以前一个镜头为条件进行生成。

在每个字符串中,请按以下顺序编写各个部分:

部分描述内容
角色与主体描述所有可见人物的外貌,包括年龄、体型、发型、面容、服装,以及适用时的说话语音音色。
动作与对话主体的行为和所说的话。
风格整体的视觉和情感美学——例如:写实的赛车电影语言、清冷的日光、克制的电影式紧张感。
镜头运动镜头类型、构图或运动方式——例如:稳定的面部特写,或从腰部以上拍摄的中景。
背景主体身后的场景设置和细节。
音效与背景音乐场景中的声音和背景音乐——例如:室内环境音、风声、脚步声和布料摩擦声,对话下方配以轻柔低沉的音乐,或无背景音乐。

4. 运行

python inference.py

输出文件保存在 inference_result/outputs/<prompt-name>/inference_<timestamp>/ 目录下。

硬件要求

在默认的 1280 × 736 × 241 帧设置下,峰值 GPU 内存为 ~46–50 GB,单个 H100/A100(80 GB)或 48 GB GPU 即可满足需求。对于显存较小的 GPU,请降低分辨率或帧数:

python inference.py --num-frames 121 --video-height 480 --video-width 832

结果

报告规模

项目数值
🎬 长时连贯故事时长5 分钟
⚡ 相较于原始多步骤流水线的生成速度提升7.5 倍
📚 基准故事数100 个
🎞️ 生成的评估镜头数3,000 个
🕒 每镜头帧数241 帧 @ 25 fps

人工评估

针对长视频和短视频生成的 GSB 用户调研。数字表示用户偏好百分比。

评估维度(长视频)JoyAI-Echo平局HappyOyster (Directing)
视觉美感63.6%8.8%27.6%
音频质量81.7%6.5%11.8%
指令遵循度80.6%13.5%5.9%
IP 一致性59.4%12.9%27.7%
评估维度(短视频)JoyAI-Echo平局Wan 2.6
视觉美感58.8%14.7%26.5%
音频质量32.3%30.9%36.8%
指令遵循度33.8%36.8%29.4%

链接

  • 项目页面:https://echo-team-joy-future-academy-jd.github.io/Echo-LongVideo-Page/
  • 推理代码:https://github.com/jd-opensource/JoyAI-Echo
  • HuggingFace:https://huggingface.co/jdopensource/JoyAI-Echo

致谢

我们衷心感谢本工作所基于的开源项目,特别是作为基础视频生成器的 LTX2.3 和作为文本编码器的 Gemma。感谢广大研究社区的贡献,使得本项目的发布成为可能。

引用

如果 JoyAI-Echo 对您的研究或产品有所帮助,请引用:

@techreport{echo2026JoyEcho,
  title        = {JoyAI-Echo: Pushing the Frontier of Long Video Generation},
  author       = {{Echo Team @ Joy Future Academy, JD}},
  institution  = {Joy Future Academy, JD},
  year         = {2026},
  month        = {May}
}

许可证

本项目基于 Lightricks Ltd. 的 LTX-2。

京东对原始 LTX-2 代码库的部分内容进行了修改,仅用于学术和研究目的。 本项目不用于商业用途。如欲将 LTX-2 或其衍生作品用于商业用途,请联系 Lightricks Ltd.。

保留 LTX-2 的所有原始版权、许可、专利、商标和归属声明。 本项目仍受《LTX-2 社区许可协议》约束。