在自己电脑上跑大模型:14款本地LLM推理工具全景图
在自己电脑上跑大模型:14款本地LLM推理工具全景图
大模型浪潮里,有一类需求越来越强烈:我不想把数据发给OpenAI,我想在自己的电脑上跑模型。
隐私考量、网络延迟、离线使用、降低成本……理由有很多,工具也很多。
今天整理一份本地LLM推理工具全景图,覆盖推理引擎、桌面GUI、高性能服务、综合管理四大类,共14款工具。
一、推理引擎(底层性能)
1. llama.cpp
GitHub: https://github.com/ggml-org/llama.cpp[1]
本地LLM的”安卓内核”,几乎所有本地推理工具的底层都依赖它。
纯C/C++实现,跨平台,支持CPU和GPU推理
支持GGUF格式模型(高效量化)
最轻量、最灵活,适合嵌入式设备
几乎所有桌面GUI工具的底层都基于它
2. Ollama
“本地模型的Docker”,一句话启动任意模型:
ollama run llama3.2
一键下载和运行模型
支持OpenAI兼容API
模型库丰富(Llama、Mistral、Gemma等)
最流行的本地推理工具之一
3. llamafile
GitHub: https://github.com/Mozilla-Ocho/llamafile[3]
“把模型变成一个可执行文件”:
单个可执行文件,无需安装
跨平台(Windows/macOS/Linux)
极简主义设计
适合追求简单快速的用户
4. MLX(Apple Silicon专用)
GitHub: https://github.com/ml-explore/mlx[4]
苹果自研芯片的机器学习框架:
针对Apple Silicon优化(M系列芯片)
高效利用统一内存架构
支持Mac上本地推理
二、桌面GUI(一键安装)
5. LM Studio
最知名的本地LLM桌面应用之一:
点点点就能运行模型
内置聊天界面
提供OpenAI兼容API
支持模型下载和管理
支持GPU加速
6. Jan
GitHub: https://github.com/janhq/jan[6]
开源的本地ChatGPT替代:
完全免费开源
支持本地和云端模型
线程式对话管理
支持多API提供商
7. GPT4All
面向普通用户的本地AI:
专为本地使用设计
开源免费
支持多种模型
界面简洁易用
8. Msty
本地LLM的统一工作区:
支持多模型同时运行
内置RAG功能
适合需要本地知识库的用户
三、高性能服务(适合部署)
9. vLLM
高性能推理服务框架:
PagedAttention技术,推理速度极快
支持Tensor Parallel分布式推理
适合生产环境部署
多数云服务商后端用它
10. SGLang
GitHub: https://github.com/sgl-project/SGLang[10]
新晋高性能推理框架:
支持RadixAttention(自动前缀缓存)
更友好的API设计
支持长上下文
性能与vLLM相当
11. TGI(Text Generation Inference)
GitHub: https://github.com/huggingface/text-generation-inference[11]
HuggingFace官方推理服务器:
HuggingFace官方出品
支持Flash Attention
支持连续批处理
适合与HuggingFace生态结合
四、综合管理平台(界面+功能)
12. Open WebUI
GitHub: https://github.com/open-webui/open-webui[12]
本地ChatGPT的开源替代:
类似ChatGPT的网页界面
支持多种LLM后端(Ollama、vLLM等)
支持RAG知识库
支持多用户和权限管理
功能最全面的本地LLM管理平台
13. AnythingLLM
官网: https://anythingllm.com[13]
专注RAG的本地LLM应用:
开箱即用的RAG知识库
支持多种文档格式
支持多模型(Ollama、OpenAI等)
适合企业私有化部署
14. LocalAI
GitHub: https://github.com/mudler/LocalAI[14]
让本地模型提供OpenAI兼容API:
完全兼容OpenAI API格式
支持语音、图片生成等多模态
Kubernetes友好
适合需要API兼容性的场景
五、特别推荐:llama-cpp-desktop
GitHub: https://github.com/Qiao-920/llama-cpp-desktop[15]
如果你用Windows系统,llama-cpp-desktop是llama.cpp的桌面控制面板:
| 功能 | 说明 |
|---|---|
| 本地直连 | 启动llama.cpp原版目录里的llama-server.exe |
| OpenAI兼容 | http://127.0.0.1:8080/v1[16] 可接入OpenClaw等客户端 |
| 桌面聊天 | 内置聊天界面,支持流式回复、历史对话、搜索 |
| 附件入口 | 支持图片、文本、PDF附件 |
| 托盘后台 | 关闭后隐藏托盘,服务继续运行 |
| 参数配置 | 支持模型路径、上下文、GPU层数、线程等 |
总结:如何选择
| 需求 | 推荐工具 |
|---|---|
| 最快的速度(生产环境) | vLLM / SGLang |
| 最简单的安装(新手) | Ollama |
| 最好看的界面 | LM Studio |
| 完全开源免费 | GPT4All / Jan |
| 需要RAG知识库 | AnythingLLM / Open WebUI |
| Windows用户 | llama-cpp-desktop |
| 苹果Mac用户 | MLX + Ollama |
| 需要API兼容性 | LocalAI |
本地LLM的生态已经非常成熟,无论你是想要最简单的使用体验,还是最高性能的生产部署,都能找到合适的工具。
本文来源:稍后阅读清单深度调研 · 小欧整理
引用链接
[1]https://github.com/ggml-org/llama.cpp
[3]https://github.com/Mozilla-Ocho/llamafile
[4]https://github.com/ml-explore/mlx
[6]https://github.com/janhq/jan
[10]https://github.com/sgl-project/SGLang
[11]https://github.com/huggingface/text-generation-inference
[12]https://github.com/open-webui/open-webui
[14]https://github.com/mudler/LocalAI