5分钟AI短片角色声音全程不变,京东开源JoyAI-Echo长视频生成框架

同一个人演着演着变成另一个人?声音突然变了?等半天才出一条视频?京东说:这些我全解决了。

AI长视频的三大”老大难”

用AI生成过视频的人都知道,目前的工具有三个让人头疼的问题:

  • 角色崩了:第一帧还是你,第十帧就变成了另一个人

  • 声音变了:同一个人说话,前后音色完全不一样

  • 等太久:生成一条10秒视频就要好几分钟,长视频更是遥遥无期

2026年6月3日,京东旗下 Joy Future Academy 推出了 JoyAI-Echo 长音视频生成框架,直接对准这三个痛点开刀。

更关键的是:代码和模型权重全部开源。

四大核心技术,逐个击破

1. 跨模态音视频记忆库

这是 JoyAI-Echo 最核心的创新。框架内置了一个专门的”记忆库”,在多镜头生成过程中,持续保存并调用角色的外观特征和说话人音色信息。

实测结果:长达5分钟的视频里,角色身份、视觉形象和声音音色都能保持高度一致。

简单说就是:AI有了”记忆力”,不会演着演着就把主角忘了。

2. 记忆驱动后训练 + DMD蒸馏加速

团队提出了记忆驱动后训练流程,结合三项关键技术:

技术 作用
SFT(监督微调) 基础能力训练
跨模态RLHF 视频+音频联合优化
DMD(分布匹配蒸馏) 推理加速

其中 DMD 一项技术就带来了约 7.5倍的速度提升。原本需要等很久的长视频生成,现在快了一个数量级。

3. Director Agent 智能导演助理

用户用自然语言描述需求,系统自动拆分成剧本、角色、场景和镜头。

最实用的功能是**”对话式编辑”**——哪里不满意,直接用对话方式告诉它修改,只重新生成有问题的局部镜头,整条视频不用重来。

这就像请了一个AI导演助理,你说”把第三个镜头的背景换成海边”,它就只改那一段。

4. 轻量化实时超分

配套专门的实时超分模块,支持两档分辨率提升:

  • 736×1280 → 1152×1920

  • 736×1280 → 1472×2560

通过单步超分就能生成高分辨率视频和精细化音频。

实测数据:全面超越竞品

研究团队基于 100个故事、3000个镜头 构建了专门的评测集。

对比 HappyOyster(长视频)

指标 JoyAI-Echo HappyOyster
视觉美学 63.6% 27.6%
音频质量 81.7% 11.8%
提示词遵循 80.6% 5.9%
IP一致性 59.4% 27.7%

对比 Wan 2.6(短视频)

指标 JoyAI-Echo Wan 2.6
视觉美学 58.8% 26.5%
音频质量 32.3% 36.8%
提示词遵循 33.8% 29.4%

音频质量上两者接近,但在长视频场景下 JoyAI-Echo 的优势是压倒性的。

技术底座:基于 LTX-2.3

JoyAI-Echo 基于开源的 LTX-2.3 视频生成模型开发,这是一个重要的技术选择:

  • LTX-2.3 本身就是一个高质量的视频生成模型

  • 京东在其基础上增加了记忆库、后训练、Director Agent等能力

  • 相当于”站在巨人肩膀上”做增量创新

⚠️ 重要提醒:项目明确标注 仅限学术研究与非商业用途。

快速上手

环境要求

  • Python 3.11 + PyTorch 2.8 + CUDA 12.8

  • GPU:H100/A100(80GB)或 48GB 显存

  • 模型权重:约 46GB + Gemma-3-12B 约 24GB

安装步骤

1
git clone https://github.com/jd-opensource/JoyAI-Echo.gitcd JoyAI-Echoconda env create -f environment.ymlconda activate echo

推理示例

1
python inference.py --config configs/inference.yaml

对于显存较小的GPU,可以降低分辨率:

1
python inference.py --num-frames 121 --video-height 480 --video-width 832

京东在AI视频赛道的卡位

JoyAI-Echo 的发布,标志着京东在长视频生成领域进入全球第一梯队。

从战略角度看:

  1. 技术储备:从文心一言到视频生成,京东在AI基础设施上的投入在加速

  2. 开源策略:代码+权重全部开源,有利于生态建设和技术影响力

  3. 应用前景:电商短视频、直播切片、广告素材等场景都有直接应用价值

  4. 学术定位:仅限非商业用途,说明京东更看重技术品牌和人才吸引力

总结

JoyAI-Echo 解决了 AI 长视频生成的三个核心痛点:角色一致性、声音稳定性和生成速度。5分钟连贯视频 + 7.5倍加速 + 对话式编辑,这三个能力组合在一起,让”AI拍电影”从概念走向了实用。

虽然目前仅限学术研究,但技术路线已经验证。一旦开放商用,对短视频、广告、影视等行业的影响将是深远的。

少做泛化展示,多做场景闭环——JoyAI-Echo 正是这句话的最好注脚。


相关链接


5分钟AI短片角色声音全程不变,京东开源JoyAI-Echo长视频生成框架
https://maoyu92.github.io/2026/06/04/07 AI笔记/AI写作与发布/a106_5分钟AI短片角色声音全程不变,京东开源JoyAI-Echo长视频生成框架/
作者
陈文茂
发布于
2026年6月4日
许可协议