DreamX-World 深度调研:最强开源交互世界模型,但你的显卡能跑吗?

前言

如果你关注 AI 视频生成,最近应该被各种”世界模型”刷屏了。从 Sora 到 Luma,从 HY-WorldPlay 到 LingBot,业界仿佛一夜之间从”生成视频”跨入了”模拟世界”——你可以在生成的场景里推拉摇移、自由导航,甚至触发事件。

6 月刚开源的 DreamX-World,来自高德地图团队(AMAP-ML),直接拿到了 5 秒基准综合评分 84.76 分,超过了 HY-WorldPlay 1.5 的 80.79 和 LingBot-World 的 80.45。它的特色很鲜明:摄像机精准控制、长时序记忆、可组合事件、支持写实/游戏/科幻多种风格。

作为一直在玩本地 AI 的人,我第一反应当然是:能不能装到我的双 5070 Ti 工作站上?

这篇文章就是深度调研的结果——有点遗憾,但也有启发。

什么是 DreamX-World?

DreamX-World 不是简单的”文生视频”模型,而是一个 交互式世界模拟器。它的核心能力:

  • 摄像机控制:WASD 移动、IJKL 旋转、组合操作,生成的画面会像真实摄像机一样响应

  • 场景记忆:绕了一圈回到之前的位置,场景布局和物体不会被忘记

  • 事件控制:同时让多个人物/物体按指令行动(”行人过马路+右转车辆+信号灯变红”)

  • 长时序生成:最长支持 60 秒连贯视频

它构建在 Wan2.2-TI2V-5B 的基础上,参数量为 5B(50 亿)。训练过程也很系统:先在合成数据上学精细控制,再学开放式事件响应,然后用强化学习对齐质量,最后用蒸馏降低推理成本。

两个版本:

版本 类型 时长 特点
DreamX-World-5B-Cam 双向扩散 5 秒 支持 ExTeRoPe 摄像机控制
DreamX-World-5B 自回归 60 秒 长时序 + 记忆检索 + 事件

竞品对比:5B 打 14B 还赢了

在论文公布的 5 秒基准测试中,DreamX-World 以 84.76 的综合评分碾压了两位更强参数的对手:

图

几个有意思的点:

  1. DreamX-5B(5B 参数) 以 84.76 分胜出,甚至超过了 14B 的 LingBot-World,说明架构设计和训练管线比盲目堆参数量重要得多

  2. 摄像机控制分 73.75——这是交互世界模型最关键的维度,直接决定了”操控感”

  3. 长时序评测中,DreamX 在 PSNR/SSIM/LPIPS 等记忆一致性指标上也全面领先

硬核数据:显存需求实测

但接下来就是让人心碎的部分了——显存需求。

官方在单张 H20(96GB 显存)上测试的峰值显存如下:

配置 分辨率 时长 峰值显存
DreamX-5B-Cam 704×1280 5 秒 38 GB
DreamX-5B 704×1280 5 秒 40 GB
DreamX-5B 长时序 704×1280 60 秒 72 GB

你没看错,最短的 5 秒生成就需要 38-40GB 显存。60 秒长时序更是飙到 72GB

图

作为对比,目前主流消费级显卡的显存:

  • RTX 5070 Ti:16 GB

  • RTX 4090:24 GB

  • 双 5090:64 GB

  • A6000:48 GB

  • A100 / H20:80-96 GB

双 5070 Ti 合计 32GB,但模型并不能简单「叠卡」——看下文分析。

本地部署可行性:逐层分析

方案一:单卡硬跑

5B 模型在 bf16 精度下,权重本身占约 10GB。加上注意力机制的中间激活(121 帧 × 704×1280 的序列长度),单卡实际需求 38-40GB

你的 16GB 5070 Ti——差了 2.4 倍,没任何机会。

方案二:双卡并行

DreamX-World 原生支持 xfuser 的 Ulysses 序列并行,理论上可以把注意力激活分散到多卡。

但问题是:

  1. 完美拆分后仍需 ~20GB/卡——16GB 仍然不够

  2. 权重重复加载——每卡都要加载完整的 10GB 权重

  3. 没有 NVLink——5070 Ti 只能走 PCIe 4.0 通信,50 步 denoising × 密集同步,效率堪忧

即使上双卡,也是「装得下跑不动」的状态。

方案三:论文中的极致优化

论文 §4.2 描述了他们实现 16 FPS 实时推理 的优化管线:

  • INT8 SageAttention(注意力层量化)

  • FP8 FFN(前馈层量化)

  • 75% 剪枝 VAE

  • TeaCache 残差复用(跳过部分步骤)

  • async pipeline 并行

但这些优化是 8 张 RTX 5090(256GB 总显存) 上的豪华配置,不是给消费级用户准备的。

结论与建议

一句话总结

DreamX-World 是目前最强的开源交互世界模型,技术含金量很高,但它最低 38GB 的显存需求将 99% 的个人玩家挡在门外。

如果你想玩怎么办?

路径 条件 成本
租云 GPU 单卡 H20 / A100-80GB 约 ¥10-20/小时
等量化版 INT8/FP8 社区版降至 ~20GB 待社区贡献
升级硬件 单卡 RTX 6000 (48GB) / 双 5090 ¥3-8 万
尝试同门师弟 HY-WorldPlay 1.5(8B)相对轻量 已开源

值得关注的方向

即使本地跑不动,DreamX-World 的技术路线值得关注:

  1. E-PRoPe 摄像机控制——比传统 3D 渲染方案轻量得多,为后续消费级产品铺平道路

  2. 场景记忆检索——用几何线索找回之前看到的画面,解决了长时序的”失忆症”

  3. 蒸馏 + RL 对齐——先用蒸馏降本、再用 RL 恢复质量,这套思路可以迁移到很多落地场景

等量化版出来,或者你手上有 4090/5090,DreamX-World 应该是第一个值得装的交互世界模型。


本文为纯技术调研,不构成任何购买建议。数据来源:DreamX-World 技术报告(arXiv 2606.16993)及官方 README。


DreamX-World 深度调研:最强开源交互世界模型,但你的显卡能跑吗?
https://maoyu92.github.io/2026/07/03/07 AI笔记/AI工具与模型/a063_DreamX-World 深度调研:最强开源交互世界模型,但你的显卡能跑吗?/
作者
陈文茂
发布于
2026年7月3日
许可协议