5分钟AI短片角色声音全程不变,京东开源JoyAI-Echo长视频生成框架
同一个人演着演着变成另一个人?声音突然变了?等半天才出一条视频?京东说:这些我全解决了。
AI长视频的三大”老大难”
用AI生成过视频的人都知道,目前的工具有三个让人头疼的问题:
角色崩了:第一帧还是你,第十帧就变成了另一个人
声音变了:同一个人说话,前后音色完全不一样
等太久:生成一条10秒视频就要好几分钟,长视频更是遥遥无期
2026年6月3日,京东旗下 Joy Future Academy 推出了 JoyAI-Echo 长音视频生成框架,直接对准这三个痛点开刀。
更关键的是:代码和模型权重全部开源。
四大核心技术,逐个击破
1. 跨模态音视频记忆库
这是 JoyAI-Echo 最核心的创新。框架内置了一个专门的”记忆库”,在多镜头生成过程中,持续保存并调用角色的外观特征和说话人音色信息。
实测结果:长达5分钟的视频里,角色身份、视觉形象和声音音色都能保持高度一致。
简单说就是:AI有了”记忆力”,不会演着演着就把主角忘了。
2. 记忆驱动后训练 + DMD蒸馏加速
团队提出了记忆驱动后训练流程,结合三项关键技术:
| 技术 | 作用 |
|---|---|
| SFT(监督微调) | 基础能力训练 |
| 跨模态RLHF | 视频+音频联合优化 |
| DMD(分布匹配蒸馏) | 推理加速 |
其中 DMD 一项技术就带来了约 7.5倍的速度提升。原本需要等很久的长视频生成,现在快了一个数量级。
3. Director Agent 智能导演助理
用户用自然语言描述需求,系统自动拆分成剧本、角色、场景和镜头。
最实用的功能是**”对话式编辑”**——哪里不满意,直接用对话方式告诉它修改,只重新生成有问题的局部镜头,整条视频不用重来。
这就像请了一个AI导演助理,你说”把第三个镜头的背景换成海边”,它就只改那一段。
4. 轻量化实时超分
配套专门的实时超分模块,支持两档分辨率提升:
736×1280 → 1152×1920
736×1280 → 1472×2560
通过单步超分就能生成高分辨率视频和精细化音频。
实测数据:全面超越竞品
研究团队基于 100个故事、3000个镜头 构建了专门的评测集。
对比 HappyOyster(长视频)
| 指标 | JoyAI-Echo | HappyOyster |
|---|---|---|
| 视觉美学 | 63.6% | 27.6% |
| 音频质量 | 81.7% | 11.8% |
| 提示词遵循 | 80.6% | 5.9% |
| IP一致性 | 59.4% | 27.7% |
对比 Wan 2.6(短视频)
| 指标 | JoyAI-Echo | Wan 2.6 |
|---|---|---|
| 视觉美学 | 58.8% | 26.5% |
| 音频质量 | 32.3% | 36.8% |
| 提示词遵循 | 33.8% | 29.4% |
音频质量上两者接近,但在长视频场景下 JoyAI-Echo 的优势是压倒性的。
技术底座:基于 LTX-2.3
JoyAI-Echo 基于开源的 LTX-2.3 视频生成模型开发,这是一个重要的技术选择:
LTX-2.3 本身就是一个高质量的视频生成模型
京东在其基础上增加了记忆库、后训练、Director Agent等能力
相当于”站在巨人肩膀上”做增量创新
⚠️ 重要提醒:项目明确标注 仅限学术研究与非商业用途。
快速上手
环境要求
Python 3.11 + PyTorch 2.8 + CUDA 12.8
GPU:H100/A100(80GB)或 48GB 显存
模型权重:约 46GB + Gemma-3-12B 约 24GB
安装步骤
1 | |
推理示例
1 | |
对于显存较小的GPU,可以降低分辨率:
1 | |
京东在AI视频赛道的卡位
JoyAI-Echo 的发布,标志着京东在长视频生成领域进入全球第一梯队。
从战略角度看:
技术储备:从文心一言到视频生成,京东在AI基础设施上的投入在加速
开源策略:代码+权重全部开源,有利于生态建设和技术影响力
应用前景:电商短视频、直播切片、广告素材等场景都有直接应用价值
学术定位:仅限非商业用途,说明京东更看重技术品牌和人才吸引力
总结
JoyAI-Echo 解决了 AI 长视频生成的三个核心痛点:角色一致性、声音稳定性和生成速度。5分钟连贯视频 + 7.5倍加速 + 对话式编辑,这三个能力组合在一起,让”AI拍电影”从概念走向了实用。
虽然目前仅限学术研究,但技术路线已经验证。一旦开放商用,对短视频、广告、影视等行业的影响将是深远的。
少做泛化展示,多做场景闭环——JoyAI-Echo 正是这句话的最好注脚。
相关链接