
书接前文,很多人把这三个当成“工具对比”。其实更有意思的是:👉 它们代表三种完全不同的力量来源,一边是纯工程黑客,一边是开发者平台,一边是产品化团队。

👉 Georgi Gerganov(独立开发者)
不是公司,没有融资故事,没有商业包装。就是一个工程师,把 LLaMA 跑在 CPU 上。
当时的世界是:
llama.cpp 做了一件“暴力但正确”的事:👉 强行让模型在本地跑
而且:
👉 属于“把算力门槛砍掉一半”的项目
👉 最低门槛:
👉 推荐配置:
👉 极端能力:
👉 llama.cpp = “底层引擎 + 极客能力”
👉 Ollama(创业团队)
有公司、有团队、有 roadmap,不是单点工具,是一个平台化产品。
llama.cpp 虽然能跑,但有个问题:👉 太“工程化”,普通人用不了
Ollama 做的事:
👉 把模型变成服务
👉 基础配置:
👉 推荐:
👉 模型级别:
很多人不知道:👉 Ollama 底层其实也是 llama.cpp (53AI)
只是做了:👉 封装 + API + 管理层
👉 Ollama = “本地模型服务器(开发用)”
👉 LM Studio(产品团队)
这不是开源工具思路。是典型:👉 消费级 AI 应用
Ollama 还是有门槛:
LM Studio 做的事:
👉 全部 UI 化
👉 LM Studio 会直接告诉你:
👉 最低:
👉 舒适:
👉 进阶:
👉 LM Studio = “本地 ChatGPT 应用”
真正的结构是这样:
硬件(CPU / GPU / 内存)
↓
llama.cpp(推理引擎)
↓
Ollama(API / 服务层)
↓
LM Studio(UI / 产品层)这三者,其实代表三种势力:
以前:👉 模型 = 云
现在:👉 模型 = 本地 + 云混合
而硬件分三档:
维度 | llama.cpp | Ollama | LM Studio |
|---|---|---|---|
背后主体 | Georgi Gerganov(个人开发者) | Ollama(创业团队) | LM Studio(产品团队) |
起源动机 | 让大模型脱离云端,直接本地运行 | 让本地模型“像 API 一样可调用” | 让普通人也能用本地模型 |
技术定位 | 推理引擎(Inference Engine) | 本地模型服务(Model Server) | 本地 AI 应用(Desktop App) |
所在层级 | 底层(最接近硬件) | 中间层(接口/服务) | 上层(用户产品) |
核心能力 | 加载 GGUF + token 推理 + 极致性能控制 | 模型管理 + API 服务 + 自动运行 | UI 操作 + 模型下载 + 可视化聊天 |
是否开源 | 完全开源 | 部分开源(核心工具链开放) | 闭源(偏产品) |
是否有 UI | ❌ 无 | ❌ 无(CLI为主) | ✅ 完整 UI |
是否提供 API | ❌(需自己封装) | ✅(OpenAI 风格) | ✅(简化版本地 API) |
模型管理 | 手动(自己下载 GGUF) | 自动(pull / run) | 图形界面下载 |
控制粒度 | 极高(线程/GPU/量化全可控) | 中等(封装后可调) | 低(偏默认配置) |
学习成本 | 高(偏工程) | 中(开发友好) | 低(小白可用) |
维度 | llama.cpp | Ollama | LM Studio |
|---|---|---|---|
最低门槛 | CPU + 16GB 内存 | CPU + 16GB 内存 | 16GB 内存 |
是否必须 GPU | ❌ 不需要 | ❌ 不需要(推荐) | ❌ 不需要(推荐) |
CPU 运行能力 | ✅ 最强(优化最好) | ✅ 可用 | ✅ 可用 |
GPU 支持 | ✅ CUDA / Metal / Vulkan | ✅ 自动调用 | ✅ 自动调用 |
Mac 适配 | ✅ 非常好(Metal) | ✅ 好 | ✅ 很好 |
MoE 模型支持 | ✅ 完整支持 | ✅(基于 llama.cpp) | ✅ |
大模型(30B+) | 可跑(需优化) | 可跑(较方便) | 可跑(但吃资源) |
性能调优能力 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐ |
模型规模 | 最低配置 | 推荐配置 | 体验评价 |
|---|---|---|---|
7B | 16GB RAM | 16GB + CPU | 流畅 |
13B / 14B | 16GB(勉强) | 32GB | 主流可用 |
30B / 35B(MoE) | 32GB | 4090 / 32GB+ Mac | 性价比最优区间 |
70B+ | 64GB+ | 多 GPU | 本地成本较高 |
场景 | 推荐工具 |
|---|---|
极限性能 / 调优 / benchmark | llama.cpp |
做 API / 接 Agent / 做系统 | Ollama |
测试模型 / 日常聊天 / 快速体验 | LM Studio |
企业系统接入(数字员工) | Ollama + llama.cpp |
本地 AI 工作站 | 三者组合 |
硬件(CPU / GPU / 内存)
↓
llama.cpp(推理引擎)
↓
Ollama(API / 服务层)
↓
LM Studio(UI / 产品层)👉 llama.cpp 是发动机 👉 Ollama 是后端服务 👉 LM Studio 是驾驶舱
真正的价值不在这三层,而在你之上的那一层:
👉 Agent / MCP / 业务流程