🎬 探索长视频生成的全新边界
用于分钟级多镜头音视频生成的官方模型权重,具备蒸馏DMD生成器、配对跨模态记忆及故事级一致性。
仅供学术研究和非商业用途。
📄 技术报告 | 🌐 项目主页 | 💻 推理代码 | 🧬 模型 | 🚀 使用方法 | 📊 结果展示 | 📝 引用方式
JoyAI-Echo 是一个长时长、多镜头、音视频生成框架,旨在突破长视频生成中存在的误差累积、时间连贯性弱以及推理延迟过高等瓶颈。跨模态视听记忆库能够在五分钟的视频中保持角色外观和语音音色的一致性,而结合基于记忆的强化学习与分布匹配蒸馏(DMD)的训练后处理流程,则实现了7.5倍的推理速度提升,同时保证了生成质量。
在长视频生成任务上,JoyAI-Echo 显著优于 HappyOyster(导演模式),在以人为中心的任务上甚至超越了短视频生成专家 Wan 2.6。
本仓库包含已发布的模型 checkpoint。推理代码将单独发布,请参见使用方法部分。
google/gemma-3-12b-it(需单独下载)在 项目页面 上探索 JoyAI-Echo 的长视频和短视频案例。🍿
推理通过独立的 JoyAI-Echo 推理仓库运行。
huggingface-cli download jdopensource/JoyAI-Echo \
--local-dir checkpoints同时下载 Gemma 文本编码器:
huggingface-cli download google/gemma-3-12b-it \
--local-dir checkpoints/gemma-3-12b预期布局:
checkpoints/
├── echo-longvideo-release.safetensors
└── gemma-3-12b/git clone https://github.com/jd-opensource/JoyAI-Echo.git
cd JoyAI-Echo环境要求:Python 3.11 + PyTorch 2.8 + CUDA 12.8(详见推理仓库的 environment.yml / requirements.txt 文件)。
请先优化您的提示词。 我们提供了提示词优化器——即系统提示词,可将简短的故事或创意扩展为结构完善的镜头提示词:prompts/long_story_writer_system_prompt.md 适用于长篇多镜头视频,prompts/short_story_writer_system_prompt.md 适用于单镜头短视频。我们强烈建议在推理前通过匹配的优化器处理您的输入;未经优化的提示词往往会导致明显较差的结果。
在 prompts/ 目录下创建一个 JSON 文件。每个文件为单个对象,包含一个 prompts 列表,其中每个字符串代表一个完整的镜头。单个字符串生成一个镜头;多个字符串则生成一个多镜头故事,每个新镜头会通过配对的音视频记忆库以前一个镜头为条件进行生成。
在每个字符串中,请按以下顺序编写各个部分:
| 部分 | 描述内容 |
|---|---|
| 角色与主体 | 描述所有可见人物的外貌,包括年龄、体型、发型、面容、服装,以及适用时的说话语音音色。 |
| 动作与对话 | 主体的行为和所说的话。 |
| 风格 | 整体的视觉和情感美学——例如:写实的赛车电影语言、清冷的日光、克制的电影式紧张感。 |
| 镜头运动 | 镜头类型、构图或运动方式——例如:稳定的面部特写,或从腰部以上拍摄的中景。 |
| 背景 | 主体身后的场景设置和细节。 |
| 音效与背景音乐 | 场景中的声音和背景音乐——例如:室内环境音、风声、脚步声和布料摩擦声,对话下方配以轻柔低沉的音乐,或无背景音乐。 |
python inference.py输出文件保存在 inference_result/outputs/<prompt-name>/inference_<timestamp>/ 目录下。
在默认的 1280 × 736 × 241 帧设置下,峰值 GPU 内存为 ~46–50 GB,单个 H100/A100(80 GB)或 48 GB GPU 即可满足需求。对于显存较小的 GPU,请降低分辨率或帧数:
python inference.py --num-frames 121 --video-height 480 --video-width 832| 项目 | 数值 |
|---|---|
| 🎬 长时连贯故事时长 | 5 分钟 |
| ⚡ 相较于原始多步骤流水线的生成速度提升 | 7.5 倍 |
| 📚 基准故事数 | 100 个 |
| 🎞️ 生成的评估镜头数 | 3,000 个 |
| 🕒 每镜头帧数 | 241 帧 @ 25 fps |
针对长视频和短视频生成的 GSB 用户调研。数字表示用户偏好百分比。
| 评估维度(长视频) | JoyAI-Echo | 平局 | HappyOyster (Directing) |
|---|---|---|---|
| 视觉美感 | 63.6% | 8.8% | 27.6% |
| 音频质量 | 81.7% | 6.5% | 11.8% |
| 指令遵循度 | 80.6% | 13.5% | 5.9% |
| IP 一致性 | 59.4% | 12.9% | 27.7% |
| 评估维度(短视频) | JoyAI-Echo | 平局 | Wan 2.6 |
|---|---|---|---|
| 视觉美感 | 58.8% | 14.7% | 26.5% |
| 音频质量 | 32.3% | 30.9% | 36.8% |
| 指令遵循度 | 33.8% | 36.8% | 29.4% |
https://echo-team-joy-future-academy-jd.github.io/Echo-LongVideo-Page/https://github.com/jd-opensource/JoyAI-Echohttps://huggingface.co/jdopensource/JoyAI-Echo我们衷心感谢本工作所基于的开源项目,特别是作为基础视频生成器的 LTX2.3 和作为文本编码器的 Gemma。感谢广大研究社区的贡献,使得本项目的发布成为可能。
如果 JoyAI-Echo 对您的研究或产品有所帮助,请引用:
@techreport{echo2026JoyEcho,
title = {JoyAI-Echo: Pushing the Frontier of Long Video Generation},
author = {{Echo Team @ Joy Future Academy, JD}},
institution = {Joy Future Academy, JD},
year = {2026},
month = {May}
}本项目基于 Lightricks Ltd. 的 LTX-2。
京东对原始 LTX-2 代码库的部分内容进行了修改,仅用于学术和研究目的。 本项目不用于商业用途。如欲将 LTX-2 或其衍生作品用于商业用途,请联系 Lightricks Ltd.。
保留 LTX-2 的所有原始版权、许可、专利、商标和归属声明。 本项目仍受《LTX-2 社区许可协议》约束。