字节跳动开源3B全能多模态模型Lance:一个模型搞定图像和视频的理解、生成与编辑
当大多数模型还在”理解”和”生成”之间二选一的时候,字节跳动直接扔出了一颗”全能选手”。
2026年5月18日,字节跳动(ByteDance Research)正式开源了一款名为 Lance 的原生统一多模态大模型。激活参数仅有 3B,却同时支持图像与视频的理解、生成和编辑三大能力,而且全部在一个框架内完成。
这就是最近在开源社区刷屏的 Lance。
🎯 一、一个模型,三种模态
Lance 的核心定位是 Native Unified Multimodal Model——原生统一多模态模型。与其堆砌多个专用模型,它选择从零开始训练,让理解与生成能力在同一个模型里土生土长。
支持的六大核心任务:
| 任务 | 说明 |
|---|---|
t2i |
文生图(Text-to-Image) |
t2v |
文生视频(Text-to-Video) |
i2v |
首帧生视频(First-Frame-to-Video) |
image_edit |
图像编辑 |
video_edit |
视频编辑 |
x2t_image / x2t_video |
图像/视频理解(看图说话、视频问答) |
也就是说——给它一张图,它能编辑;给它一段文字,它能生成图像或视频;给它一个视频,它能理解并回答问题。
而且全部用同一组权重。
⚙️ 技术架构:双流MoE + 模态感知RoPE
3B 参数跑出接近 7B 的效果,字节是怎么做到的?核心技术就两个:
1. 双流混合专家(MoE)架构
传统的多模态模型在处理交织的图像-视频-文本序列时,理解任务和生成任务的计算路径会相互干扰。Lance 的做法是强制隔离——用双流 MoE 架构,让理解和生成各走各的路,互不打架。
2. 模态感知的旋转位置编码(Modality-aware RoPE)
图像 tokens 和视频 tokens 天然异构,信号干扰严重。Lance 引入模态感知的 RoPE,削弱不同视觉 token 之间的噪声,让每个模态都能”听清”自己的信号。
3. 从零开始,分阶段训练
整个训练过程只用 128 张 A100 GPU,预算压缩到了极致,但图像生成最高支持 768×768,视频生成支持 480p、12 FPS,完全不虚。
📊 性能表现:3B 参数,硬刚大模型
光看参数不够直观,来跑跑 benchmark。
VBench 视频生成评测(越高越好):
| 模型 | 参数量 | 总分 |
|---|---|---|
| Wan2.1-T2V | 14B | 83.69 |
| Hunyuan Video | - | 83.43 |
| CogVideoX | 5B | 81.61 |
| 🌟 Lance | 3B | 85.11 |
GenEval 图像生成评测(越高越好):
| 模型 | 参数量 | 总体得分 |
|---|---|---|
| Qwen-Image | 20B | 0.87 |
| BAGEL | 7B | 0.88 |
| Mogao | 7B | 0.89 |
| 🌟 Lance | 3B | 0.90 |
3B 参数的 Lance 在两项关键 benchmark 上双双跑到了同批统一模型里的最高分,甚至超越多个 7B 模型。这才是真正的小钢炮。
显存需求(bf16 推理):约 6GB,RTX 3090 能跑,Mac M 系列芯片也能跑。
🖥️ 本地部署:手把手教程
Lance 支持本地推理,以下是完整安装流程(默认 PyTorch 2.8.0 + cu126):
第一步:克隆代码库
git clone https://github.com/bytedance/Lance.git cd Lance
第二步:创建环境
conda create -n Lance python=3.11 -y conda activate Lance pip install torch==2.8.0 torchvision==0.23.0 torchaudio==2.8.0 \ --index-url https://download.pytorch.org/whl/cu126 pip install -r requirements.txt pip install flash-attn==2.8.3 --no-build-isolation
⚠️ 至少需要 40GB 显存的 GPU(A100 或同等规格)。
第三步:下载模型权重
from huggingface_hub import snapshot_download save_dir = "./downloads/" repo_id = "bytedance-research/Lance" cache_dir = save_dir + "/cache" snapshot_download( cache_dir=cache_dir, local_dir=save_dir, repo_id=repo_id, local_dir_use_symlinks=False, resume_download=True, allow_patterns=["*.json", "*.safetensors", "*.bin", "*.py", "*.md", "*.txt", "*.pth"], )
第四步:运行推理
# 文生视频 bash inference_lance.sh \ --TASK_NAME t2v \ --MODEL_PATH downloads/Lance_3B_Video \ --RESOLUTION video_480p \ --NUM_FRAMES 121 \ --VIDEO_HEIGHT 480 \ --VIDEO_WIDTH 848 \ --SAVE_PATH_GEN results/t2v # 文生图 bash inference_lance.sh \ --TASK_NAME t2i \ --MODEL_PATH downloads/Lance_3B \ --RESOLUTION image_768res \ --VIDEO_HEIGHT 768 \ --VIDEO_WIDTH 768 \ --SAVE_PATH_GEN results/t2i
第五步:启动 Gradio 可视化界面
python lance_gradio.py --server-name 0.0.0.0 --server-port 7860
启动后在浏览器打开 http://localhost:7860,即可通过图形界面体验文生图、文生视频、图像/视频编辑和理解全部功能。
🌐 在线体验
不想装?直接体验:
🔗 Hugging Face Space(官方 Demo): https://huggingface.co/spaces/bytedance-research/Lance[1]
🔗 项目主页(含更多视觉效果): https://lance-project.github.io/[2]
📚 相关链接
Hugging Face 模型:https://huggingface.co/bytedance-research/Lance[4]
Hugging Face Space:https://huggingface.co/spaces/bytedance-research/Lance[5]
arXiv 论文:http://arxiv.org/abs/2605.18678[6]
引用方式:
@misc{fu2026lanceunifiedmultimodalmodeling, title={Lance: Unified Multimodal Modeling by Multi-Task Synergy}, author={Fengyi Fu and Mengqi Huang and Shaojin Wu and Yunsheng Jiang et al.}, year={2026}, eprint={2605.18678}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2605.18678}, }
当”统一多模态”还在被大多数团队当作三年计划的时候,字节已经用 3B 参数 + 128 张 A100 把它跑出来了。而且开源了。
这件事本身,比 Lance 模型本身更值得思考。
引用链接
[1]https://huggingface.co/spaces/bytedance-research/Lance
[2]https://lance-project.github.io/
[3]https://github.com/bytedance/Lance
[4]https://huggingface.co/bytedance-research/Lance
[5]https://huggingface.co/spaces/bytedance-research/Lance