本地大模型计算器
你的电脑能跑哪个本地大模型?速度有多快?
选择你的 Mac 或 PC,看看哪些开放权重模型装得进它的内存、生成速度有多快、读一份文档要多久,以及它们擅长什么。
适合这台电脑的模型
在 32 GB 的 M6 上:36 个模型中有 28 个运行流畅。
Twoody 会在这台 Mac 上安装的模型
Qwen3.5 9B,一键安装,对话长度 16k token。
运行流畅 · 每秒 14–25 个 token (比你阅读快) · 25 秒 读完 20 页
在这台电脑上运行流畅
19.2 / 20.3 GB
运行流畅
每秒 36–64 个 token
感觉即时
10 秒 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
- 代码
- 推理
- 智能体
20.1 / 20.3 GB
运行流畅
每秒 32–57 个 token
几乎即时
11 秒 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
- 代码
- 推理
- 智能体
20.1 / 20.3 GB
运行流畅
每秒 32–57 个 token
几乎即时
11 秒 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
- 代码
- 智能体
12.7 / 20.3 GB
运行流畅
每秒 30–54 个 token
几乎即时
12 秒 读完 20 页
- 聊天与写作
- 你的文档
- 代码
- 推理
- 智能体
17.7 / 20.3 GB
运行流畅
每秒 29–52 个 token
几乎即时
13 秒 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
- 代码
- 智能体
17 / 20.3 GB
运行流畅
每秒 6.7–12 个 token
和你的阅读速度差不多
60 秒 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
- 代码
- 智能体
17 / 20.3 GB
运行流畅
每秒 6.7–12 个 token
和你的阅读速度差不多
60 秒 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
- 代码
- 智能体
19.8 / 20.3 GB
运行流畅
每秒 5.3–9.4 个 token
和你的阅读速度差不多
79 秒 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
- 代码
- 智能体
17.6 / 20.3 GB
运行流畅
每秒 4.9–8.8 个 token
和你的阅读速度差不多
71 秒 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
- 代码
- 推理
- 智能体
7.3 / 20.3 GB
运行流畅
每秒 18–33 个 token
几乎即时
20 秒 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
7.7 / 20.3 GB
运行流畅
每秒 18–32 个 token
几乎即时
21 秒 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
- 推理
7.7 / 20.3 GB
运行流畅
每秒 18–32 个 token
几乎即时
21 秒 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
- 推理
7.7 / 20.3 GB
运行流畅
每秒 17–31 个 token
几乎即时
22 秒 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
6.7 / 20.3 GB
运行流畅
每秒 14–25 个 token
比你阅读快
25 秒 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
- 推理
8.1 / 20.3 GB
运行流畅
每秒 13–23 个 token
比你阅读快
30 秒 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
11.1 / 20.3 GB
运行流畅
每秒 11–20 个 token
比你阅读快
35 秒 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
12.3 / 20.3 GB
运行流畅
每秒 11–19 个 token
比你阅读快
37 秒 读完 20 页
- 聊天与写作
- 你的文档
- 推理
11.8 / 20.3 GB
运行流畅
每秒 10–19 个 token
比你阅读快
37 秒 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
- 推理
4.2 / 20.3 GB
运行流畅
每秒 40–72 个 token
感觉即时
8 秒 读完 20 页
- 聊天与写作
- 翻译
4.9 / 20.3 GB
运行流畅
每秒 33–59 个 token
几乎即时
10 秒 读完 20 页
- 聊天与写作
5.2 / 20.3 GB
运行流畅
每秒 32–58 个 token
几乎即时
10 秒 读完 20 页
- 聊天与写作
- 翻译
5.9 / 20.3 GB
运行流畅
每秒 30–53 个 token
几乎即时
11 秒 读完 20 页
- 聊天与写作
- 翻译
3.7 / 20.3 GB
运行流畅
每秒 27–47 个 token
几乎即时
12 秒 读完 20 页
- 聊天与写作
- 翻译
2.6 / 20.3 GB
运行流畅
每秒 81–244 个 token
感觉即时
2 秒 读完 20 页
3.3 / 20.3 GB
运行流畅
每秒 45–136 个 token
感觉即时
4 秒 读完 20 页
3.8 / 20.3 GB
运行流畅
每秒 54–96 个 token
感觉即时
6 秒 读完 20 页
1.9 / 20.3 GB
运行流畅
每秒 53–95 个 token
感觉即时
5 秒 读完 20 页
2.7 / 20.3 GB
运行流畅
每秒 47–83 个 token
感觉即时
6 秒 读完 20 页
能运行,但慢很多 (2)
22.5 / 20.3 GB
部分在处理器上运行:慢很多
每秒 13–23 个 token
比你阅读快
22 秒 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
- 代码
- 推理
- 智能体
23.8 / 20.3 GB
部分在处理器上运行:慢很多
每秒 1.9–3.5 个 token
比你阅读慢
3 分钟 读完 20 页
- 聊天与写作
- 你的文档
- 翻译
- 代码
- 推理
- 智能体
对这台电脑来说太大(6)
- Llama 3.3 70B · 47.1 / 20.3 GB
- Qwen3-Next 80B-A3B · 48.3 / 20.3 GB
- gpt-oss-120b · 63.1 / 20.3 GB
- Mistral Small 4 119B · 71.1 / 20.3 GB
- Qwen3.5 122B-A10B · 75.7 / 20.3 GB
- Qwen3 235B-A22B · 142.4 / 20.3 GB
以上为估算值而非实测值,依据 llama.cpp 公开基准测试计算。数据核对于 2026年9月26日。
本地大模型需要多少内存?
内存决定了能装下哪些模型:模型文件本身,加上它要记住的对话内容。Mac 在 32 GB 及以下时,大约三分之二的内存可供图形处理器使用,32 GB 以上约为四分之三。使用 4 位文件时,能流畅运行的是:
| 内存 | 推荐:运行流畅 |
|---|---|
| 8 GB | Llama 3.2 3B, Phi-4-mini, Qwen3.5 4B |
| 16 GB | Llama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B |
| 24 GB | gpt-oss-20b, Llama 3.1 8B, Qwen3 8B |
| 32 GB | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 48 GB | GLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B |
| 64 GB | Llama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B |
| 128 GB | Qwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B |
| 256 GB | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
| 512 GB | Qwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B |
为什么内存带宽决定速度
每生成一个词,电脑都要从内存中读取模型的活跃权重。因此速度更多取决于内存带宽,而不是处理器性能。Qwen3 8B(4 位)在几台机器上的表现:
| 电脑 | 内存带宽 | 生成速度 |
|---|---|---|
| M1 | 68 GB/s | 每秒 8.7–12 个 token |
| M2 | 100 GB/s | 每秒 13–19 个 token |
| M4 | 120 GB/s | 每秒 15–21 个 token |
| M5 | 153 GB/s | 每秒 19–27 个 token |
| M4 Pro | 273 GB/s | 每秒 31–45 个 token |
| M4 Max | 546 GB/s | 每秒 53–76 个 token |
| M5 Max | 614 GB/s | 每秒 72–104 个 token |
| GeForce RTX 4090 (24 GB) | 1,008 GB/s | 每秒 100+ 个 token |
4 位还是 8 位?
模型以压缩形式发布。4 位文件(Q4_K_M,gpt-oss 则为 MXFP4)只有 8 位文件的一半大小,质量损失很小:这正是 Twoody 安装的版本,也是大多数电脑的正确选择。8 位稍微精细一些,但需要两倍的内存。
每秒多少 token:实际感受如何
一个 token 大约相当于四分之三个英文单词。默读速度约为每秒 5 到 6 个 token。
| 低于 5 | 比你阅读慢 |
| 5 到 10 | 和你的阅读速度差不多 |
| 10 到 20 | 比你阅读快 |
| 20 到 50 | 几乎即时 |
| 高于 50 | 感觉即时 |
会先思考的模型,在回答之前要写 300 到 3000 个 token 的推理过程:按每秒 10 个 token 计算,需要半分钟到五分钟。在 Twoody 中,“Fast”“Thinking”和“Deep”设置决定它思考多久。
读一份文档
在回答关于某份文档的问题之前,模型要先把它读一遍,而这正是新款芯片提升最大的地方。Qwen3 8B 在 16 GB 内存下读一份 20 页的文档:
| M1 | 3 分钟 |
| M4 | 76 秒 |
| M5 | 27 秒 |
Mac 还是 PC?
Mac 的处理器和图形处理器共享内存:一台 64 GB 的 Mac 能运行任何 24 GB 显卡都装不下的模型。PC 显卡的显存较小,但读取速度非常快:只要模型装得下,RTX 4090 的生成速度比任何 Mac 都快。Twoody 正在 Mac、Windows 和 Linux 上内测:在 Windows 上,驱动支持时它会通过 Vulkan 使用显卡;在 Linux 上,它在处理器上运行模型。
按电脑分类的最佳本地大模型
方法与来源
每台机器的速度,是根据它在 llama.cpp 参考模型(LLaMA 2 7B,4 位)上的实测速度,按各模型每生成一个词需要读取的数据量换算,并结合 Apple 和 NVIDIA 规格中的内存带宽计算得出。我们用 20 项未参与建模的公开实测数据进行了核对:误差中位数 4.5%,最大 23%,全部落在所示范围内。
数据核对于 2026年9月26日。
来源
- www.apple.com/newsroom/
- support.apple.com/specs
- github.com/ggml-org/llama.cpp/discussions/4167
- github.com/ggml-org/llama.cpp/discussions/15013
- github.com/ggml-org/llama.cpp/discussions/10879
- github.com/ggml-org/llama.cpp/discussions/15396
- www.nvidia.com/en-us/geforce/graphics-cards/compare/
- huggingface.co/models
- www.sciencedirect.com/science/article/abs/pii/S0749596X19300786
关于在本地运行大模型的问题
8 GB 内存能运行本地大模型吗?
可以,小模型就行:Qwen3 4B 或 Qwen3.5 4B 能在 8 GB 的 Mac 上运行,足以处理邮件、摘要和简单问题。使用时请关闭占用资源较多的应用。Twoody 会在这类 Mac 上安装 Qwen3.5 4B。
16 GB 的 Mac 适合哪个大模型?
70 亿到 90 亿参数的模型:Qwen3 8B、Qwen3.5 9B 或 Llama 3.1 8B 在新款 Mac 上每秒约生成 15 到 25 个 token,回答关于你文档的问题也很出色。Twoody 会安装 Qwen3.5 9B。
70B 模型需要多少内存?
4 位文件加上一段简短对话,大约需要 48 GB:64 GB 的 Mac 能运行 Llama 3.3 70B,视芯片不同每秒生成 7 到 13 个 token。gpt-oss-120b 等混合专家模型需要更多内存,但生成速度快得多。
4 位模型比 8 位差很多吗?
略差一点。对于写作、摘要和文档问答,差别很难察觉,而 4 位能把内存减半、速度翻倍。只有内存非常充裕时才选 8 位。
跑本地大模型,选 Mac 还是 NVIDIA 显卡?
只要模型装得进显存(8 到 32 GB),显卡生成更快;Mac 的统一内存(最高 512 GB)则能容纳大得多的模型。对于一个人处理文档来说,16 到 64 GB 的 Mac 是最简单的选择。
本地大模型会让 MacBook Air 过热吗?
MacBook Air 没有风扇:连续生成几分钟后,它会降速以保持凉爽。正常长度的回答察觉不到;如果要长时间使用,MacBook Pro 或 Mac mini 能保持速度。
我需要 LM Studio、Ollama 或 MLX 吗?
用 Twoody 就不需要:它一键安装模型,并用自带的引擎 llama.cpp 运行。如果你已经在用 LM Studio 或 Ollama,或在 Mac 上用 mlx-lm,Twoody 也能使用它们的模型。
这些估算有多准确?
在 20 项未用于建立公式的公开实测数据上,误差中位数为 4.5%,最大为 23%;每一项都落在所示范围内。你的实际速度还取决于所用应用、其版本,以及电脑同时在做的其他事情。
Twoody 正处于内测阶段。
支持 Mac、Windows 和 Linux,免费,无需账户,无需订阅;也支持 iPhone 和 Android,配合你电脑上的 Twoody 使用。留下你的电子邮件地址:Twoody 向你开放时,我们会写信通知你。