DreamX-World 深度调研:最强开源交互世界模型,但你的显卡能跑吗?
前言
如果你关注 AI 视频生成,最近应该被各种”世界模型”刷屏了。从 Sora 到 Luma,从 HY-WorldPlay 到 LingBot,业界仿佛一夜之间从”生成视频”跨入了”模拟世界”——你可以在生成的场景里推拉摇移、自由导航,甚至触发事件。
6 月刚开源的 DreamX-World,来自高德地图团队(AMAP-ML),直接拿到了 5 秒基准综合评分 84.76 分,超过了 HY-WorldPlay 1.5 的 80.79 和 LingBot-World 的 80.45。它的特色很鲜明:摄像机精准控制、长时序记忆、可组合事件、支持写实/游戏/科幻多种风格。
作为一直在玩本地 AI 的人,我第一反应当然是:能不能装到我的双 5070 Ti 工作站上?
这篇文章就是深度调研的结果——有点遗憾,但也有启发。
什么是 DreamX-World?
DreamX-World 不是简单的”文生视频”模型,而是一个 交互式世界模拟器。它的核心能力:
摄像机控制:WASD 移动、IJKL 旋转、组合操作,生成的画面会像真实摄像机一样响应
场景记忆:绕了一圈回到之前的位置,场景布局和物体不会被忘记
事件控制:同时让多个人物/物体按指令行动(”行人过马路+右转车辆+信号灯变红”)
长时序生成:最长支持 60 秒连贯视频
它构建在 Wan2.2-TI2V-5B 的基础上,参数量为 5B(50 亿)。训练过程也很系统:先在合成数据上学精细控制,再学开放式事件响应,然后用强化学习对齐质量,最后用蒸馏降低推理成本。
两个版本:
| 版本 | 类型 | 时长 | 特点 |
|---|---|---|---|
| DreamX-World-5B-Cam | 双向扩散 | 5 秒 | 支持 ExTeRoPe 摄像机控制 |
| DreamX-World-5B | 自回归 | 60 秒 | 长时序 + 记忆检索 + 事件 |
竞品对比:5B 打 14B 还赢了
在论文公布的 5 秒基准测试中,DreamX-World 以 84.76 的综合评分碾压了两位更强参数的对手:

几个有意思的点:
DreamX-5B(5B 参数) 以 84.76 分胜出,甚至超过了 14B 的 LingBot-World,说明架构设计和训练管线比盲目堆参数量重要得多
摄像机控制分 73.75——这是交互世界模型最关键的维度,直接决定了”操控感”
长时序评测中,DreamX 在 PSNR/SSIM/LPIPS 等记忆一致性指标上也全面领先
硬核数据:显存需求实测
但接下来就是让人心碎的部分了——显存需求。
官方在单张 H20(96GB 显存)上测试的峰值显存如下:
| 配置 | 分辨率 | 时长 | 峰值显存 |
|---|---|---|---|
| DreamX-5B-Cam | 704×1280 | 5 秒 | 38 GB |
| DreamX-5B | 704×1280 | 5 秒 | 40 GB |
| DreamX-5B 长时序 | 704×1280 | 60 秒 | 72 GB |
你没看错,最短的 5 秒生成就需要 38-40GB 显存。60 秒长时序更是飙到 72GB。

作为对比,目前主流消费级显卡的显存:
RTX 5070 Ti:16 GB
RTX 4090:24 GB
双 5090:64 GB
A6000:48 GB
A100 / H20:80-96 GB
双 5070 Ti 合计 32GB,但模型并不能简单「叠卡」——看下文分析。
本地部署可行性:逐层分析
方案一:单卡硬跑
5B 模型在 bf16 精度下,权重本身占约 10GB。加上注意力机制的中间激活(121 帧 × 704×1280 的序列长度),单卡实际需求 38-40GB。
你的 16GB 5070 Ti——差了 2.4 倍,没任何机会。
方案二:双卡并行
DreamX-World 原生支持 xfuser 的 Ulysses 序列并行,理论上可以把注意力激活分散到多卡。
但问题是:
完美拆分后仍需 ~20GB/卡——16GB 仍然不够
权重重复加载——每卡都要加载完整的 10GB 权重
没有 NVLink——5070 Ti 只能走 PCIe 4.0 通信,50 步 denoising × 密集同步,效率堪忧
即使上双卡,也是「装得下跑不动」的状态。
方案三:论文中的极致优化
论文 §4.2 描述了他们实现 16 FPS 实时推理 的优化管线:
INT8 SageAttention(注意力层量化)
FP8 FFN(前馈层量化)
75% 剪枝 VAE
TeaCache 残差复用(跳过部分步骤)
async pipeline 并行
但这些优化是 8 张 RTX 5090(256GB 总显存) 上的豪华配置,不是给消费级用户准备的。
结论与建议
一句话总结
DreamX-World 是目前最强的开源交互世界模型,技术含金量很高,但它最低 38GB 的显存需求将 99% 的个人玩家挡在门外。
如果你想玩怎么办?
| 路径 | 条件 | 成本 |
|---|---|---|
| 租云 GPU | 单卡 H20 / A100-80GB | 约 ¥10-20/小时 |
| 等量化版 | INT8/FP8 社区版降至 ~20GB | 待社区贡献 |
| 升级硬件 | 单卡 RTX 6000 (48GB) / 双 5090 | ¥3-8 万 |
| 尝试同门师弟 | HY-WorldPlay 1.5(8B)相对轻量 | 已开源 |
值得关注的方向
即使本地跑不动,DreamX-World 的技术路线值得关注:
E-PRoPe 摄像机控制——比传统 3D 渲染方案轻量得多,为后续消费级产品铺平道路
场景记忆检索——用几何线索找回之前看到的画面,解决了长时序的”失忆症”
蒸馏 + RL 对齐——先用蒸馏降本、再用 RL 恢复质量,这套思路可以迁移到很多落地场景
等量化版出来,或者你手上有 4090/5090,DreamX-World 应该是第一个值得装的交互世界模型。
本文为纯技术调研,不构成任何购买建议。数据来源:DreamX-World 技术报告(arXiv 2606.16993)及官方 README。