本地大模型计算器
适合你的 MacBook Pro 的最佳本地大模型
从 8 GB 的 M1 到 128 GB 的 M5 Max:每款 MacBook Pro 能流畅运行的最强模型,以及它的生成速度。
| 你的电脑 | 内存 | 推荐:运行流畅 | 生成速度 | 在 Twoody 中一键安装 |
|---|---|---|---|---|
M5 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 每秒 100+ 个 token | Qwen3.5 9B |
| 48 GB | GLM-4.7-Flash | 每秒 100+ 个 token | Qwen3.5 9B | |
| 64 GB | GLM-4.7-Flash | 每秒 100+ 个 token | Qwen3.5 9B | |
| 128 GB | Qwen3-Next 80B-A3B | 每秒 96–193 个 token | Qwen3.5 9B | |
M5 Pro — MacBook Pro, Mac mini |
24 GB | gpt-oss-20b | 每秒 68–97 个 token | Qwen3.5 9B |
| 48 GB | GLM-4.7-Flash | 每秒 92–132 个 token | Qwen3.5 9B | |
| 64 GB | GLM-4.7-Flash | 每秒 92–132 个 token | Qwen3.5 9B | |
M5 — MacBook Air, MacBook Pro |
16 GB | Llama 3.1 8B | 每秒 20–28 个 token | Qwen3.5 9B |
| 24 GB | gpt-oss-20b | 每秒 32–47 个 token | Qwen3.5 9B | |
| 32 GB | GLM-4.7-Flash | 每秒 41–59 个 token | Qwen3.5 9B | |
M4 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 每秒 73–106 个 token | Qwen3.5 9B |
| 48 GB | gpt-oss-20b | 每秒 85–122 个 token | Qwen3.5 9B | |
| 64 GB | gpt-oss-20b | 每秒 85–122 个 token | Qwen3.5 9B | |
| 128 GB | Qwen3-Next 80B-A3B | 每秒 53–107 个 token | Qwen3.5 9B | |
M4 Pro — MacBook Pro, Mac mini |
24 GB | gpt-oss-20b | 每秒 52–74 个 token | Qwen3.5 9B |
| 48 GB | GLM-4.7-Flash | 每秒 56–81 个 token | Qwen3.5 9B | |
| 64 GB | GLM-4.7-Flash | 每秒 56–81 个 token | Qwen3.5 9B | |
M4 — MacBook Air, MacBook Pro, Mac mini, iMac |
16 GB | Llama 3.1 8B | 每秒 15–22 个 token | Qwen3.5 9B |
| 24 GB | gpt-oss-20b | 每秒 25–36 个 token | Qwen3.5 9B | |
| 32 GB | GLM-4.7-Flash | 每秒 32–46 个 token | Qwen3.5 9B | |
M3 Max — MacBook Pro |
36 GB | GLM-4.7-Flash | 每秒 68–97 个 token | Qwen3.5 9B |
| 48 GB | gpt-oss-20b | 每秒 68–98 个 token | Qwen3.5 9B | |
| 64 GB | gpt-oss-20b | 每秒 68–98 个 token | Qwen3.5 9B | |
| 96 GB | Qwen3-Next 80B-A3B | 每秒 47–93 个 token | Qwen3.5 9B | |
| 128 GB | Qwen3-Next 80B-A3B | 每秒 46–93 个 token | Qwen3.5 9B | |
M3 Pro — MacBook Pro |
18 GB | Llama 3.1 8B | 每秒 19–28 个 token | Qwen3.5 9B |
| 36 GB | GLM-4.7-Flash | 每秒 42–60 个 token | Qwen3.5 9B | |
M3 — MacBook Air, MacBook Pro, iMac |
8 GB | Llama 3.2 3B | 每秒 31–45 个 token | Qwen3.5 4B |
| 16 GB | Llama 3.1 8B | 每秒 13–19 个 token | Qwen3.5 9B | |
| 24 GB | gpt-oss-20b | 每秒 23–32 个 token | Qwen3.5 9B | |
M2 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 每秒 62–90 个 token | Qwen3.5 9B |
| 64 GB | gpt-oss-20b | 每秒 62–90 个 token | Qwen3.5 9B | |
| 96 GB | Qwen3-Next 80B-A3B | 每秒 39–78 个 token | Qwen3.5 9B | |
M2 Pro — MacBook Pro, Mac mini |
16 GB | Llama 3.1 8B | 每秒 24–35 个 token | Qwen3.5 9B |
| 32 GB | GLM-4.7-Flash | 每秒 45–65 个 token | Qwen3.5 9B | |
M2 — MacBook Air, MacBook Pro, Mac mini |
8 GB | Llama 3.2 3B | 每秒 32–45 个 token | Qwen3.5 4B |
| 16 GB | Llama 3.1 8B | 每秒 13–19 个 token | Qwen3.5 9B | |
| 24 GB | gpt-oss-20b | 每秒 23–33 个 token | Qwen3.5 9B | |
M1 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 每秒 56–80 个 token | Qwen3.5 9B |
| 64 GB | gpt-oss-20b | 每秒 56–80 个 token | Qwen3.5 9B | |
M1 Pro — MacBook Pro |
16 GB | Llama 3.1 8B | 每秒 23–33 个 token | Qwen3.5 9B |
| 32 GB | GLM-4.7-Flash | 每秒 39–56 个 token | Qwen3.5 9B | |
M1 — MacBook Air, MacBook Pro, Mac mini, iMac |
8 GB | Llama 3.2 3B | 每秒 20–29 个 token | Qwen3.5 4B |
| 16 GB | Llama 3.1 8B | 每秒 8.9–13 个 token | Qwen3.5 9B |
以上为估算值而非实测值,依据 llama.cpp 公开基准测试计算。数据核对于 2026年9月26日。
内存决定模型的大小:16 GB 对应 80 亿参数,32 到 48 GB 对应 Qwen3 30B-A3B 等混合专家模型,64 GB 及以上对应 700 亿参数的模型。
Pro 和 Max 芯片读取内存的速度是基础款芯片的两到五倍:这正是它们运行大模型时生成飞快的原因。
有风扇加持,MacBook Pro 在长时间使用中也能保持速度,无论用电池还是接电源。
关于在本地运行大模型的问题
M4 Max 的 MacBook Pro 适合哪个大模型?
64 GB 或以上时,可选 gpt-oss-120b(需 128 GB)、Llama 3.3 70B 或 Qwen3 30B-A3B;混合专家模型的生成速度比稠密的 70B 快好几倍。
48 GB 对 MacBook Pro 意味着什么?
它能流畅运行 Qwen3 30B-A3B 或 gpt-oss-20b 等混合专家模型,每秒生成几十个 token,还能给其他应用留出空间。
本地大模型会耗光 MacBook Pro 的电池吗?
生成一个回答时,图形处理器会满负荷运转几秒钟;两次回答之间,模型处于等待状态,不消耗算力。用电池长时间处理文档没问题;连续生成好几个小时则不行。
按电脑分类的最佳本地大模型
Twoody 正处于内测阶段。
支持 Mac、Windows 和 Linux,免费,无需账户,无需订阅;也支持 iPhone 和 Android,配合你电脑上的 Twoody 使用。留下你的电子邮件地址:Twoody 向你开放时,我们会写信通知你。