3秒出图、离线运行:这个「轻量级」模型把Stable Diffusion塞进了手机
“
ByteVisionLab 开源 DreamLite:0.39B 参数的统一端侧生图模型,支持文生图和图生图双模式,iPhone 17 Pro 上 4 步推理只需 3 秒。来看看它是怎么做到的。
3秒出图、离线运行:这个「轻量级」模型把Stable Diffusion塞进了手机
最近开源社区出现了一个很有意思的项目——DreamLite,来自 ByteVisionLab。
它的核心特点是:把文生图和图生图两种能力合一,压缩到只有 0.39B 参数(约 3.9 亿参数),在手机上跑 4 步推理,3 秒出一张 1024×1024 图。

它解决什么问题
传统 Stable Diffusion 效果好,但太大了。FLUX.1-Dev 12B 参数,光模型文件就几十 GB,跑一张图要几十秒,离不开高配显卡和云端。
移动端想跑?更难。
SnapGen++ 已经做到 0.4B 参数,但生成质量和编辑能力还是偏弱。DreamLite 的思路是:在轻量化前提下,同时做好生图和编辑两件事。
核心架构:怎么做到的
DreamLite 用了几个关键技术:
1. 修剪过的 Mobile U-Net 主干网络 不是简单压缩,而是重新设计了一个适合移动端的主干,保留了核心生成能力。
2. In-Context Spatial Concatenation(上下文空间拼接) 在潜空间里直接拼接多模态条件(文本 + 图像),不需要额外的 adapters 或复杂注入机制,一个网络搞定两种任务。
3. Progressive Step Distillation(逐步步数蒸馏) 把 28 步压缩到 4 步,生成质量基本不掉。mobile 版只需要 4 步就能出图。
性能对比
| 模型 | 参数量 | GenEval ↑ | DPG ↑ | ImgEdit ↑ |
|---|---|---|---|---|
| FLUX.1-Dev | 12B | 0.67 | 84.0 | 3.76 |
| OmniGen2 | 4B | 0.80 | 83.6 | 3.44 |
| DeepGen1.0 | 2B | 0.83 | 84.6 | 4.03 |
| DreamLite | 0.39B | 0.72 | 85.8 | 4.11 |
0.39B 对比 12B,GenEval 只差 0.05,但参数量差了 30 倍,这个效率非常可观。
两个版本怎么选
| 版本 | 步数 | 特点 | 适用场景 |
|---|---|---|---|
| DreamLite-base | 28步 | 高保真,质量最佳 | PC/工作站,追求最优效果 |
| DreamLite-mobile | 4步 | 极速,3秒出图 | 手机/端侧设备,即时生成 |
base 版 28 步,生成质量和 FLUX 差距已经很小了;mobile 版 4 步,速度快到可以实时交互。
实际体验:我本地的测试结果
我在 Windows + RTX 3060 上跑了 mobile 版,以下是真实测试截图:
PyTorch + CUDA 验证:

首次加载 pipeline 十几秒,之后 4 步推理只要几秒。RTX 3060 12GB 完全跑得动。
文生图测试(电子电路板):

Prompt: a realistic photo of a small electronic circuit board on a workbench, sharp details
生成结果质量已经相当可用。
图生图编辑测试:
输入图:

编辑 Prompt: 用红线圈出图中的漂浮物
编辑结果:

从这次测试看,图像编辑功能(输入一张图,按 prompt 修改局部)目前稳定性稍弱,尤其是需要精确理解图片内容再做局部编辑时,效果不如纯文生图稳定。这个问题不只是 DreamLite,几乎所有端侧模型都有这个短板。
结论:对「理解图片 + 精准标注异常区域」这类任务,当前端侧模型的编辑能力还不够稳,需要配合检测/分割模型一起用。
模型文件大小参考
mobile 版权重目录约 5GB,其中 text_encoder 单文件约 4.26GB。目录结构如下:
models/DreamLite-mobile/ ├── text_encoder/ # 4.26 GB ├── unet/ # 780 MB └── vae/ # 4.9 MB
直接搬到手机上不行,但可以通过拆分 pipeline + 量化的方式做端侧部署。
开源与许可
代码是 Apache 2.0,完全开源,可以商用。模型权重是 CC BY-NC 4.0,个人研究和非商业用途免费,需要邮件申请权限。
LoRA 微调也开源了,可以在自己的数据集上做轻量定制。
我的判断
DreamLite 是目前端侧轻量化生成模型里,值得重点关注的一个:
架构统一、代码干净:不是修修补补的压缩,而是从设计层面考虑了端侧约束
生成 + 编辑双能力:很多轻量模型只能生图,DreamLite 两个都有
LoRA 支持:不只是跑 demo,可以落地到具体业务场景
开源态度认真:有完整技术报告、有 Gradio demo、有 benchmark 代码
如果你的方向是:
移动端 AI 生图应用
端侧图像编辑工具
离线环境下的小型生成模型
DreamLite 值得放进技术选型列表里。
相关链接:
引用链接
[1]https://github.com/ByteVisionLab/DreamLite
[2]https://arxiv.org/abs/2603.28713