在自己电脑上跑大模型:14款本地LLM推理工具全景图

在自己电脑上跑大模型:14款本地LLM推理工具全景图

大模型浪潮里,有一类需求越来越强烈:我不想把数据发给OpenAI,我想在自己的电脑上跑模型

隐私考量、网络延迟、离线使用、降低成本……理由有很多,工具也很多。

今天整理一份本地LLM推理工具全景图,覆盖推理引擎、桌面GUI、高性能服务、综合管理四大类,共14款工具。


一、推理引擎(底层性能)

1. llama.cpp

GitHub: https://github.com/ggml-org/llama.cpp[1]

本地LLM的”安卓内核”,几乎所有本地推理工具的底层都依赖它。

  • 纯C/C++实现,跨平台,支持CPU和GPU推理

  • 支持GGUF格式模型(高效量化)

  • 最轻量、最灵活,适合嵌入式设备

  • 几乎所有桌面GUI工具的底层都基于它

2. Ollama

官网: https://ollama.com[2]

“本地模型的Docker”,一句话启动任意模型:

ollama run llama3.2

  • 一键下载和运行模型

  • 支持OpenAI兼容API

  • 模型库丰富(Llama、Mistral、Gemma等)

  • 最流行的本地推理工具之一

3. llamafile

GitHub: https://github.com/Mozilla-Ocho/llamafile[3]

“把模型变成一个可执行文件”:

  • 单个可执行文件,无需安装

  • 跨平台(Windows/macOS/Linux)

  • 极简主义设计

  • 适合追求简单快速的用户

4. MLX(Apple Silicon专用)

GitHub: https://github.com/ml-explore/mlx[4]

苹果自研芯片的机器学习框架:

  • 针对Apple Silicon优化(M系列芯片)

  • 高效利用统一内存架构

  • 支持Mac上本地推理


二、桌面GUI(一键安装)

5. LM Studio

官网: https://lmstudio.ai[5]

最知名的本地LLM桌面应用之一:

  • 点点点就能运行模型

  • 内置聊天界面

  • 提供OpenAI兼容API

  • 支持模型下载和管理

  • 支持GPU加速

6. Jan

GitHub: https://github.com/janhq/jan[6]

开源的本地ChatGPT替代:

  • 完全免费开源

  • 支持本地和云端模型

  • 线程式对话管理

  • 支持多API提供商

7. GPT4All

官网: https://gpt4all.io[7]

面向普通用户的本地AI:

  • 专为本地使用设计

  • 开源免费

  • 支持多种模型

  • 界面简洁易用

8. Msty

官网: https://msty.app[8]

本地LLM的统一工作区:

  • 支持多模型同时运行

  • 内置RAG功能

  • 适合需要本地知识库的用户


三、高性能服务(适合部署)

9. vLLM

官网: https://vllm.ai[9]

高性能推理服务框架:

  • PagedAttention技术,推理速度极快

  • 支持Tensor Parallel分布式推理

  • 适合生产环境部署

  • 多数云服务商后端用它

10. SGLang

GitHub: https://github.com/sgl-project/SGLang[10]

新晋高性能推理框架:

  • 支持RadixAttention(自动前缀缓存)

  • 更友好的API设计

  • 支持长上下文

  • 性能与vLLM相当

11. TGI(Text Generation Inference)

GitHub: https://github.com/huggingface/text-generation-inference[11]

HuggingFace官方推理服务器:

  • HuggingFace官方出品

  • 支持Flash Attention

  • 支持连续批处理

  • 适合与HuggingFace生态结合


四、综合管理平台(界面+功能)

12. Open WebUI

GitHub: https://github.com/open-webui/open-webui[12]

本地ChatGPT的开源替代:

  • 类似ChatGPT的网页界面

  • 支持多种LLM后端(Ollama、vLLM等)

  • 支持RAG知识库

  • 支持多用户和权限管理

  • 功能最全面的本地LLM管理平台

13. AnythingLLM

官网: https://anythingllm.com[13]

专注RAG的本地LLM应用:

  • 开箱即用的RAG知识库

  • 支持多种文档格式

  • 支持多模型(Ollama、OpenAI等)

  • 适合企业私有化部署

14. LocalAI

GitHub: https://github.com/mudler/LocalAI[14]

让本地模型提供OpenAI兼容API:

  • 完全兼容OpenAI API格式

  • 支持语音、图片生成等多模态

  • Kubernetes友好

  • 适合需要API兼容性的场景


五、特别推荐:llama-cpp-desktop

GitHub: https://github.com/Qiao-920/llama-cpp-desktop[15]

如果你用Windows系统,llama-cpp-desktop是llama.cpp的桌面控制面板

功能 说明
本地直连 启动llama.cpp原版目录里的llama-server.exe
OpenAI兼容 http://127.0.0.1:8080/v1[16] 可接入OpenClaw等客户端
桌面聊天 内置聊天界面,支持流式回复、历史对话、搜索
附件入口 支持图片、文本、PDF附件
托盘后台 关闭后隐藏托盘,服务继续运行
参数配置 支持模型路径、上下文、GPU层数、线程等

总结:如何选择

需求 推荐工具
最快的速度(生产环境) vLLM / SGLang
最简单的安装(新手) Ollama
最好看的界面 LM Studio
完全开源免费 GPT4All / Jan
需要RAG知识库 AnythingLLM / Open WebUI
Windows用户 llama-cpp-desktop
苹果Mac用户 MLX + Ollama
需要API兼容性 LocalAI

本地LLM的生态已经非常成熟,无论你是想要最简单的使用体验,还是最高性能的生产部署,都能找到合适的工具。


本文来源:稍后阅读清单深度调研 · 小欧整理

引用链接

[1]https://github.com/ggml-org/llama.cpp

[2]https://ollama.com

[3]https://github.com/Mozilla-Ocho/llamafile

[4]https://github.com/ml-explore/mlx

[5]https://lmstudio.ai

[6]https://github.com/janhq/jan

[7]https://gpt4all.io

[8]https://msty.app

[9]https://vllm.ai

[10]https://github.com/sgl-project/SGLang

[11]https://github.com/huggingface/text-generation-inference

[12]https://github.com/open-webui/open-webui

[13]https://anythingllm.com

[14]https://github.com/mudler/LocalAI

[15]https://github.com/Qiao-920/llama-cpp-desktop

[16]http://127.0.0.1:8080/v1


在自己电脑上跑大模型:14款本地LLM推理工具全景图
https://maoyu92.github.io/2026/05/08/07 AI笔记/AI工具与模型/a184_在自己电脑上跑大模型:14款本地LLM推理工具全景图/
作者
陈文茂
发布于
2026年5月8日
许可协议