Twoody

本地大模型计算器

你的电脑能跑哪个本地大模型?速度有多快?

选择你的 Mac 或 PC,看看哪些开放权重模型装得进它的内存、生成速度有多快、读一份文档要多久,以及它们擅长什么。

我的 Mac 是哪一款?在苹果菜单 ›“关于本机”中可以看到芯片和内存。PC 上:“任务管理器”›“性能”› GPU。

适合这台电脑的模型

在 32 GB 的 M6 上:36 个模型中有 28 个运行流畅。

Twoody 会在这台 Mac 上安装的模型

Qwen3.5 9B,一键安装,对话长度 16k token。

运行流畅 · 每秒 14–25 个 token (比你阅读快) · 25 秒 读完 20 页

加入候补名单

在这台电脑上运行流畅

GLM-4.7-Flash

Z.ai · MIT

通过 LM Studio、Ollama 或 mlx-lm

19.2 / 20.3 GB

运行流畅

每秒 36–64 个 token

感觉即时

10 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
  • 代码
  • 推理
  • 智能体
Qwen3 30B-A3B

Qwen (Alibaba) · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

20.1 / 20.3 GB

运行流畅

每秒 32–57 个 token

几乎即时

11 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
  • 代码
  • 推理
  • 智能体
Qwen3-Coder 30B-A3B

Qwen (Alibaba) · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

20.1 / 20.3 GB

运行流畅

每秒 32–57 个 token

几乎即时

11 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
  • 代码
  • 智能体
gpt-oss-20b

OpenAI · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

12.7 / 20.3 GB

运行流畅

每秒 30–54 个 token

几乎即时

12 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 代码
  • 推理
  • 智能体
Gemma 4 26B-A4B

Google · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

17.7 / 20.3 GB

运行流畅

每秒 29–52 个 token

几乎即时

13 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
  • 代码
  • 智能体
Mistral Small 3.2 24B

Mistral AI · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

17 / 20.3 GB

运行流畅

每秒 6.7–12 个 token

和你的阅读速度差不多

60 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
  • 代码
  • 智能体
Devstral Small 2 24B

Mistral AI · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

17 / 20.3 GB

运行流畅

每秒 6.7–12 个 token

和你的阅读速度差不多

60 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
  • 代码
  • 智能体
Gemma 4 31B

Google · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

19.8 / 20.3 GB

运行流畅

每秒 5.3–9.4 个 token

和你的阅读速度差不多

79 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
  • 代码
  • 智能体
Qwen3.8 27B

Qwen (Alibaba) · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

17.6 / 20.3 GB

运行流畅

每秒 4.9–8.8 个 token

和你的阅读速度差不多

71 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
  • 代码
  • 推理
  • 智能体
Llama 3.1 8B

Meta · Llama 3.1 Community

通过 LM Studio、Ollama 或 mlx-lm

7.3 / 20.3 GB

运行流畅

每秒 18–33 个 token

几乎即时

20 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
Qwen3 8B

Qwen (Alibaba) · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

7.7 / 20.3 GB

运行流畅

每秒 18–32 个 token

几乎即时

21 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
  • 推理
DeepSeek-R1-0528-Qwen3-8B

DeepSeek · MIT

通过 LM Studio、Ollama 或 mlx-lm

7.7 / 20.3 GB

运行流畅

每秒 18–32 个 token

几乎即时

21 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
  • 推理
Ministral 3 8B

Mistral AI · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

7.7 / 20.3 GB

运行流畅

每秒 17–31 个 token

几乎即时

22 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
Qwen3.5 9B

Qwen (Alibaba) · Apache 2.0

在 Twoody 中一键安装

6.7 / 20.3 GB

运行流畅

每秒 14–25 个 token

比你阅读快

25 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
  • 推理
Gemma 4 12B

Google · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

8.1 / 20.3 GB

运行流畅

每秒 13–23 个 token

比你阅读快

30 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
Ministral 3 14B

Mistral AI · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

11.1 / 20.3 GB

运行流畅

每秒 11–20 个 token

比你阅读快

35 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
Phi-4 14B

Microsoft · MIT

通过 LM Studio、Ollama 或 mlx-lm

12.3 / 20.3 GB

运行流畅

每秒 11–19 个 token

比你阅读快

37 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 推理
Qwen3 14B

Qwen (Alibaba) · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

11.8 / 20.3 GB

运行流畅

每秒 10–19 个 token

比你阅读快

37 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
  • 推理
Llama 3.2 3B

Meta · Llama 3.2 Community

通过 LM Studio、Ollama 或 mlx-lm

4.2 / 20.3 GB

运行流畅

每秒 40–72 个 token

感觉即时

8 秒 读完 20 页

  • 聊天与写作
  • 翻译
Phi-4-mini

Microsoft · MIT

通过 LM Studio、Ollama 或 mlx-lm

4.9 / 20.3 GB

运行流畅

每秒 33–59 个 token

几乎即时

10 秒 读完 20 页

  • 聊天与写作
Qwen3 4B

Qwen (Alibaba) · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

5.2 / 20.3 GB

运行流畅

每秒 32–58 个 token

几乎即时

10 秒 读完 20 页

  • 聊天与写作
  • 翻译
Gemma 4 E4B

Google · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

5.9 / 20.3 GB

运行流畅

每秒 30–53 个 token

几乎即时

11 秒 读完 20 页

  • 聊天与写作
  • 翻译
Qwen3.5 4B

Qwen (Alibaba) · Apache 2.0

在 Twoody 中一键安装

3.7 / 20.3 GB

运行流畅

每秒 27–47 个 token

几乎即时

12 秒 读完 20 页

  • 聊天与写作
  • 翻译
Qwen3 0.6B

Qwen (Alibaba) · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

2.6 / 20.3 GB

运行流畅

每秒 81–244 个 token

感觉即时

2 秒 读完 20 页

Qwen3 1.7B

Qwen (Alibaba) · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

3.3 / 20.3 GB

运行流畅

每秒 45–136 个 token

感觉即时

4 秒 读完 20 页

Gemma 4 E2B

Google · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

3.8 / 20.3 GB

运行流畅

每秒 54–96 个 token

感觉即时

6 秒 读完 20 页

Qwen3.5 2B

Qwen (Alibaba) · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

1.9 / 20.3 GB

运行流畅

每秒 53–95 个 token

感觉即时

5 秒 读完 20 页

MiniCPM5 2B

OpenBMB · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

2.7 / 20.3 GB

运行流畅

每秒 47–83 个 token

感觉即时

6 秒 读完 20 页

能运行,但慢很多 (2)
Qwen3.6 35B-A3B

Qwen (Alibaba) · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

22.5 / 20.3 GB

部分在处理器上运行:慢很多

每秒 13–23 个 token

比你阅读快

22 秒 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
  • 代码
  • 推理
  • 智能体
Qwen3 32B

Qwen (Alibaba) · Apache 2.0

通过 LM Studio、Ollama 或 mlx-lm

23.8 / 20.3 GB

部分在处理器上运行:慢很多

每秒 1.9–3.5 个 token

比你阅读慢

3 分钟 读完 20 页

  • 聊天与写作
  • 你的文档
  • 翻译
  • 代码
  • 推理
  • 智能体
对这台电脑来说太大(6)
  • Llama 3.3 70B · 47.1 / 20.3 GB
  • Qwen3-Next 80B-A3B · 48.3 / 20.3 GB
  • gpt-oss-120b · 63.1 / 20.3 GB
  • Mistral Small 4 119B · 71.1 / 20.3 GB
  • Qwen3.5 122B-A10B · 75.7 / 20.3 GB
  • Qwen3 235B-A22B · 142.4 / 20.3 GB

以上为估算值而非实测值,依据 llama.cpp 公开基准测试计算。数据核对于 2026年9月26日。

本地大模型需要多少内存?

内存决定了能装下哪些模型:模型文件本身,加上它要记住的对话内容。Mac 在 32 GB 及以下时,大约三分之二的内存可供图形处理器使用,32 GB 以上约为四分之三。使用 4 位文件时,能流畅运行的是:

内存推荐:运行流畅
8 GBLlama 3.2 3B, Phi-4-mini, Qwen3.5 4B
16 GBLlama 3.1 8B, Qwen3 8B, DeepSeek-R1-0528-Qwen3-8B
24 GBgpt-oss-20b, Llama 3.1 8B, Qwen3 8B
32 GBGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
48 GBGLM-4.7-Flash, Qwen3 30B-A3B, Qwen3-Coder 30B-A3B
64 GBLlama 3.3 70B, GLM-4.7-Flash, Qwen3 30B-A3B
128 GBQwen3-Next 80B-A3B, gpt-oss-120b, Mistral Small 4 119B
256 GBQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B
512 GBQwen3 235B-A22B, gpt-oss-120b, Mistral Small 4 119B

为什么内存带宽决定速度

每生成一个词,电脑都要从内存中读取模型的活跃权重。因此速度更多取决于内存带宽,而不是处理器性能。Qwen3 8B(4 位)在几台机器上的表现:

电脑 内存带宽 生成速度
M1 68 GB/s 每秒 8.7–12 个 token
M2 100 GB/s 每秒 13–19 个 token
M4 120 GB/s 每秒 15–21 个 token
M5 153 GB/s 每秒 19–27 个 token
M4 Pro 273 GB/s 每秒 31–45 个 token
M4 Max 546 GB/s 每秒 53–76 个 token
M5 Max 614 GB/s 每秒 72–104 个 token
GeForce RTX 4090 (24 GB) 1,008 GB/s 每秒 100+ 个 token

4 位还是 8 位?

模型以压缩形式发布。4 位文件(Q4_K_M,gpt-oss 则为 MXFP4)只有 8 位文件的一半大小,质量损失很小:这正是 Twoody 安装的版本,也是大多数电脑的正确选择。8 位稍微精细一些,但需要两倍的内存。

每秒多少 token:实际感受如何

一个 token 大约相当于四分之三个英文单词。默读速度约为每秒 5 到 6 个 token。

低于 5比你阅读慢
5 到 10和你的阅读速度差不多
10 到 20比你阅读快
20 到 50几乎即时
高于 50感觉即时

会先思考的模型,在回答之前要写 300 到 3000 个 token 的推理过程:按每秒 10 个 token 计算,需要半分钟到五分钟。在 Twoody 中,“Fast”“Thinking”和“Deep”设置决定它思考多久。

读一份文档

在回答关于某份文档的问题之前,模型要先把它读一遍,而这正是新款芯片提升最大的地方。Qwen3 8B 在 16 GB 内存下读一份 20 页的文档:

M13 分钟
M476 秒
M527 秒

Mac 还是 PC?

Mac 的处理器和图形处理器共享内存:一台 64 GB 的 Mac 能运行任何 24 GB 显卡都装不下的模型。PC 显卡的显存较小,但读取速度非常快:只要模型装得下,RTX 4090 的生成速度比任何 Mac 都快。Twoody 正在 Mac、Windows 和 Linux 上内测:在 Windows 上,驱动支持时它会通过 Vulkan 使用显卡;在 Linux 上,它在处理器上运行模型。

按电脑分类的最佳本地大模型

方法与来源

每台机器的速度,是根据它在 llama.cpp 参考模型(LLaMA 2 7B,4 位)上的实测速度,按各模型每生成一个词需要读取的数据量换算,并结合 Apple 和 NVIDIA 规格中的内存带宽计算得出。我们用 20 项未参与建模的公开实测数据进行了核对:误差中位数 4.5%,最大 23%,全部落在所示范围内。

数据核对于 2026年9月26日。

来源

下载数据(JSON,CC BY 4.0)

关于在本地运行大模型的问题

8 GB 内存能运行本地大模型吗?

可以,小模型就行:Qwen3 4B 或 Qwen3.5 4B 能在 8 GB 的 Mac 上运行,足以处理邮件、摘要和简单问题。使用时请关闭占用资源较多的应用。Twoody 会在这类 Mac 上安装 Qwen3.5 4B。

16 GB 的 Mac 适合哪个大模型?

70 亿到 90 亿参数的模型:Qwen3 8B、Qwen3.5 9B 或 Llama 3.1 8B 在新款 Mac 上每秒约生成 15 到 25 个 token,回答关于你文档的问题也很出色。Twoody 会安装 Qwen3.5 9B。

70B 模型需要多少内存?

4 位文件加上一段简短对话,大约需要 48 GB:64 GB 的 Mac 能运行 Llama 3.3 70B,视芯片不同每秒生成 7 到 13 个 token。gpt-oss-120b 等混合专家模型需要更多内存,但生成速度快得多。

4 位模型比 8 位差很多吗?

略差一点。对于写作、摘要和文档问答,差别很难察觉,而 4 位能把内存减半、速度翻倍。只有内存非常充裕时才选 8 位。

跑本地大模型,选 Mac 还是 NVIDIA 显卡?

只要模型装得进显存(8 到 32 GB),显卡生成更快;Mac 的统一内存(最高 512 GB)则能容纳大得多的模型。对于一个人处理文档来说,16 到 64 GB 的 Mac 是最简单的选择。

本地大模型会让 MacBook Air 过热吗?

MacBook Air 没有风扇:连续生成几分钟后,它会降速以保持凉爽。正常长度的回答察觉不到;如果要长时间使用,MacBook Pro 或 Mac mini 能保持速度。

我需要 LM Studio、Ollama 或 MLX 吗?

用 Twoody 就不需要:它一键安装模型,并用自带的引擎 llama.cpp 运行。如果你已经在用 LM Studio 或 Ollama,或在 Mac 上用 mlx-lm,Twoody 也能使用它们的模型。

这些估算有多准确?

在 20 项未用于建立公式的公开实测数据上,误差中位数为 4.5%,最大为 23%;每一项都落在所示范围内。你的实际速度还取决于所用应用、其版本,以及电脑同时在做的其他事情。

Twoody 正处于内测阶段。

支持 Mac、Windows 和 Linux,免费,无需账户,无需订阅;也支持 iPhone 和 Android,配合你电脑上的 Twoody 使用。留下你的电子邮件地址:Twoody 向你开放时,我们会写信通知你。