Ollama 与 LM Studio 怎么上手
上一节算出了你能跑什么,这一节把它装起来。两个工具,一个命令行一个图形界面,第一次用十分钟能跑通。
Ollama
- 一条命令下载并运行,没有多余步骤
- 装好后自动在后台提供服务,可以直接被程序调用
- 接口兼容 OpenAI 的格式,原来调 API 的代码改个地址就能用
- 没有图形界面,换模型、调参数都要敲命令
LM Studio
- 内置模型浏览器,能看到体积和量化档位再决定下不下
- 会提示当前机器能不能带得动,对新手很友好
- 也能开本地服务器,同样兼容 OpenAI 格式
- 在 Apple 芯片上支持 MLX 引擎,比通用格式更快
装好 Ollama 之后,只需要一条命令。以上一节算出你能跑 8B 为例:
ollama run qwen3:8b
就这一句。本地没有就先下载,下完自动进入对话。想只下载不运行,把 run 换成 pull。其余常用命令:
# 看已经下载了哪些模型,以及各占多少空间
ollama list
# 删掉不用的,本地模型很占硬盘
ollama rm qwen3:8b
# 看当前正在占用显存的模型
ollama ps
装好后 Ollama 会在本机 11434 端口提供服务,接口格式跟 OpenAI 一致。也就是说你手上现成的 OpenAI 调用代码,把 base_url 指过来就能跑,模型名填标签名即可。
from openai import OpenAI
# 本地服务不校验密钥,api_key 随便填一个非空值
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
resp = client.chat.completions.create(
model="qwen3:8b",
messages=[{"role": "user", "content": "用一句话解释什么是量化"}],
)
print(resp.choices[0].message.content)
上面那条命令里的 8b 是举例。你自己该敲哪个数字,取决于你的机器。选一下,下面直接给出你能复制走的那条。
把上面那个选择器里的机型换着点一遍,会看出一件反直觉的事:决定你能跑多大模型的不是显卡多贵,是显存多大。一张 RTX 4090 停在 30B,而一台统一内存 128 GB 的 Mac 能吃下 122B——后者的图形算力远不如前者,但模型装得进去,前者装不进去。
- RTX 4090(24 GB 显存)→ 最大 Qwen3-30B-A3B,需 19.5 GB
- Mac 统一内存 128 GB(约 96 GB 可用)→ 最大 Qwen3.5-122B-A10B,需 79.3 GB
这也是大内存 Mac 在本地跑模型这件事上唯一说得通的理由。它的优势不是快,是装得下:同样的钱买独显,显存到 24 GB 就到头了,而统一内存能堆到 128 GB 以上,中间这一段没有别的消费级设备能补。如果你的用途就是在本地跑大尺寸模型,内存容量比 GPU 型号重要得多。
冒号后面那串不是随便写的,每一段都有含义。
ollama.com/library 对应模型的 tags 页确认当前有哪些尺寸与档位。核对日期 2026-08-07。
在模型库里搜索
搜模型名,列表会列出各个量化版本的体积。界面会根据你的机器提示哪些带得动,这一点比命令行直观很多。
下载后直接聊天
加载模型时可以调上下文长度和 GPU 分配。这两个参数直接影响显存占用,先用默认值跑通再调。
需要给程序调用时,开本地服务器
在服务器面板里启动,同样是 OpenAI 兼容接口,用法和上面的 Ollama 例子一样,只是端口不同。
Mac 用户注意选 MLX 版本
如果模型有 MLX 格式,优先选它。这是针对 Apple 芯片优化的引擎,同样的模型速度会明显好于通用格式。
- 上下文开太大,显存直接爆。这是最高频的问题。模型加载时显存看着够,一旦把上下文拉到几十 K,KV Cache 涨上来就崩了。现象是生成到一半卡死,或者速度突然慢到不可用。先按默认上下文跑通,需要长文再一档一档往上加。
- 显存不够时不一定报错。有些工具会自动把装不下的部分放到内存里,靠 CPU 算。结果是能跑,但慢十倍以上。如果你发现生成速度慢得离谱,先检查是不是没完全装进显存。
- 硬盘会被吃掉。一个 8B 的 Q4 模型三四个 GB,试几个模型就是几十个 GB。定期用
ollama list看一眼,不用的删掉。
到这里,你手上有三种用模型的方式了。它们不是替代关系,各有各的场合:
- 本地跑。数据不能外发、要长期高频调用、或者想完全不受服务商影响时。代价是能力上限受硬件限制。
- 官方 API。要最强能力、不想管运维时。按量付费,用多少算多少。
- 中转站。便利性和风险并存,具体的取舍在《什么是 API 中转站》那一节讲过,涉及数据经手第三方的问题,选之前建议回去再看一眼。
这一章到此结束。你现在应该能自己判断一个模型的开放程度、知道小模型是怎么来的和它的代价、并且能在自己的机器上把它跑起来。