3秒出图、离线运行:这个「轻量级」模型把Stable Diffusion塞进了手机

ByteVisionLab 开源 DreamLite:0.39B 参数的统一端侧生图模型,支持文生图和图生图双模式,iPhone 17 Pro 上 4 步推理只需 3 秒。来看看它是怎么做到的。

3秒出图、离线运行:这个「轻量级」模型把Stable Diffusion塞进了手机

最近开源社区出现了一个很有意思的项目——DreamLite,来自 ByteVisionLab。

它的核心特点是:把文生图和图生图两种能力合一,压缩到只有 0.39B 参数(约 3.9 亿参数),在手机上跑 4 步推理,3 秒出一张 1024×1024 图

DreamLite 架构图

它解决什么问题

传统 Stable Diffusion 效果好,但太大了。FLUX.1-Dev 12B 参数,光模型文件就几十 GB,跑一张图要几十秒,离不开高配显卡和云端。

移动端想跑?更难。

SnapGen++ 已经做到 0.4B 参数,但生成质量和编辑能力还是偏弱。DreamLite 的思路是:在轻量化前提下,同时做好生图和编辑两件事

核心架构:怎么做到的

DreamLite 用了几个关键技术:

1. 修剪过的 Mobile U-Net 主干网络 不是简单压缩,而是重新设计了一个适合移动端的主干,保留了核心生成能力。

2. In-Context Spatial Concatenation(上下文空间拼接) 在潜空间里直接拼接多模态条件(文本 + 图像),不需要额外的 adapters 或复杂注入机制,一个网络搞定两种任务。

3. Progressive Step Distillation(逐步步数蒸馏) 把 28 步压缩到 4 步,生成质量基本不掉。mobile 版只需要 4 步就能出图。

性能对比

模型 参数量 GenEval ↑ DPG ↑ ImgEdit ↑
FLUX.1-Dev 12B 0.67 84.0 3.76
OmniGen2 4B 0.80 83.6 3.44
DeepGen1.0 2B 0.83 84.6 4.03
DreamLite 0.39B 0.72 85.8 4.11

0.39B 对比 12B,GenEval 只差 0.05,但参数量差了 30 倍,这个效率非常可观。

两个版本怎么选

版本 步数 特点 适用场景
DreamLite-base 28步 高保真,质量最佳 PC/工作站,追求最优效果
DreamLite-mobile 4步 极速,3秒出图 手机/端侧设备,即时生成

base 版 28 步,生成质量和 FLUX 差距已经很小了;mobile 版 4 步,速度快到可以实时交互。

实际体验:我本地的测试结果

我在 Windows + RTX 3060 上跑了 mobile 版,以下是真实测试截图:

PyTorch + CUDA 验证:

PyTorch CUDA 验证截图

首次加载 pipeline 十几秒,之后 4 步推理只要几秒。RTX 3060 12GB 完全跑得动。

文生图测试(电子电路板):

电路板生图结果

Prompt: a realistic photo of a small electronic circuit board on a workbench, sharp details

生成结果质量已经相当可用。

图生图编辑测试:

输入图:

输入图

编辑 Prompt: 用红线圈出图中的漂浮物

编辑结果:

编辑结果

从这次测试看,图像编辑功能(输入一张图,按 prompt 修改局部)目前稳定性稍弱,尤其是需要精确理解图片内容再做局部编辑时,效果不如纯文生图稳定。这个问题不只是 DreamLite,几乎所有端侧模型都有这个短板。

结论:对「理解图片 + 精准标注异常区域」这类任务,当前端侧模型的编辑能力还不够稳,需要配合检测/分割模型一起用。

模型文件大小参考

mobile 版权重目录约 5GB,其中 text_encoder 单文件约 4.26GB。目录结构如下:

models/DreamLite-mobile/ ├── text_encoder/ # 4.26 GB ├── unet/ # 780 MB └── vae/ # 4.9 MB

直接搬到手机上不行,但可以通过拆分 pipeline + 量化的方式做端侧部署。

开源与许可

代码是 Apache 2.0,完全开源,可以商用。模型权重是 CC BY-NC 4.0,个人研究和非商业用途免费,需要邮件申请权限。

LoRA 微调也开源了,可以在自己的数据集上做轻量定制。

我的判断

DreamLite 是目前端侧轻量化生成模型里,值得重点关注的一个:

  1. 架构统一、代码干净:不是修修补补的压缩,而是从设计层面考虑了端侧约束

  2. 生成 + 编辑双能力:很多轻量模型只能生图,DreamLite 两个都有

  3. LoRA 支持:不只是跑 demo,可以落地到具体业务场景

  4. 开源态度认真:有完整技术报告、有 Gradio demo、有 benchmark 代码

如果你的方向是:

  • 移动端 AI 生图应用

  • 端侧图像编辑工具

  • 离线环境下的小型生成模型

DreamLite 值得放进技术选型列表里。


相关链接:

引用链接

[1]https://github.com/ByteVisionLab/DreamLite

[2]https://arxiv.org/abs/2603.28713

[3]https://huggingface.co/spaces/carlofkl/DreamLite

[4]https://carlofkl.github.io/dreamlite/


3秒出图、离线运行:这个「轻量级」模型把Stable Diffusion塞进了手机
https://maoyu92.github.io/2026/05/06/07 AI笔记/AI写作与发布/a190_3秒出图、离线运行:这个「轻量级」模型把Stable Diffusion塞进了手机/
作者
陈文茂
发布于
2026年5月6日
许可协议