Twoody

本地大模型计算器

适合你的 Mac mini 的最佳本地大模型

从 M1 到 M6,以及 Pro 版本:每款 Mac mini 能流畅运行的最强模型,以及它的生成速度。

你的电脑 内存 推荐:运行流畅 生成速度 在 Twoody 中一键安装

M5 Pro — MacBook Pro, Mac mini

24 GB gpt-oss-20b 每秒 68–97 个 token Qwen3.5 9B
48 GB GLM-4.7-Flash 每秒 92–132 个 token Qwen3.5 9B
64 GB GLM-4.7-Flash 每秒 92–132 个 token Qwen3.5 9B

M6 — Mac mini

16 GB Llama 3.1 8B 每秒 17–31 个 token Qwen3.5 9B
24 GB gpt-oss-20b 每秒 30–54 个 token Qwen3.5 9B
32 GB GLM-4.7-Flash 每秒 36–64 个 token Qwen3.5 9B

M4 Pro — MacBook Pro, Mac mini

24 GB gpt-oss-20b 每秒 52–74 个 token Qwen3.5 9B
48 GB GLM-4.7-Flash 每秒 56–81 个 token Qwen3.5 9B
64 GB GLM-4.7-Flash 每秒 56–81 个 token Qwen3.5 9B

M4 — MacBook Air, MacBook Pro, Mac mini, iMac

16 GB Llama 3.1 8B 每秒 15–22 个 token Qwen3.5 9B
24 GB gpt-oss-20b 每秒 25–36 个 token Qwen3.5 9B
32 GB GLM-4.7-Flash 每秒 32–46 个 token Qwen3.5 9B

M2 Pro — MacBook Pro, Mac mini

16 GB Llama 3.1 8B 每秒 24–35 个 token Qwen3.5 9B
32 GB GLM-4.7-Flash 每秒 45–65 个 token Qwen3.5 9B

M2 — MacBook Air, MacBook Pro, Mac mini

8 GB Llama 3.2 3B 每秒 32–45 个 token Qwen3.5 4B
16 GB Llama 3.1 8B 每秒 13–19 个 token Qwen3.5 9B
24 GB gpt-oss-20b 每秒 23–33 个 token Qwen3.5 9B

M1 — MacBook Air, MacBook Pro, Mac mini, iMac

8 GB Llama 3.2 3B 每秒 20–29 个 token Qwen3.5 4B
16 GB Llama 3.1 8B 每秒 8.9–13 个 token Qwen3.5 9B

以上为估算值而非实测值,依据 llama.cpp 公开基准测试计算。数据核对于 2026年9月26日。

Mac mini 是在 Mac 上运行本地大模型最便宜的方式:16 GB 可跑 80 亿参数的模型,48 GB 加 Pro 芯片可跑混合专家模型。

安静且可以一直开着,Mac mini 也正是内测中的 iPhone 和 Android 应用设计用来远程使用的那类电脑。

Pro 版本读取内存的速度是基础款芯片的两倍多:能跑更大的模型,回答也更快。

关于在本地运行大模型的问题

16 GB 的 Mac mini M4 适合哪个大模型?

Qwen3.5 9B、Qwen3 8B 或 Llama 3.1 8B 都能流畅运行,每秒约生成 15 到 21 个 token。Twoody 一键安装 Qwen3.5 9B。

为了本地 AI 买 Mac mini M4 Pro 值得吗?

如果是 48 或 64 GB,值得:它能以每秒几十个 token 的速度运行 Qwen3 30B-A3B 或 gpt-oss-20b 等混合专家模型。

Mac mini 能为其他设备提供本地大模型吗?

这正是内测中的 iPhone 和 Android 应用所做的事:它们在手机上使用你 Mac 上的模型。

按电脑分类的最佳本地大模型

Twoody 正处于内测阶段。

支持 Mac、Windows 和 Linux,免费,无需账户,无需订阅;也支持 iPhone 和 Android,配合你电脑上的 Twoody 使用。留下你的电子邮件地址:Twoody 向你开放时,我们会写信通知你。