本地大模型计算器
适合你的 Mac Studio 的最佳本地大模型
从 M1 Max 到 512 GB 的 M5 Ultra:Mac 能容纳的最大模型,以及它们的生成速度。
| 你的电脑 | 内存 | 推荐:运行流畅 | 生成速度 | 在 Twoody 中一键安装 |
|---|---|---|---|---|
M5 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 每秒 100+ 个 token | Qwen3.5 9B |
| 48 GB | GLM-4.7-Flash | 每秒 100+ 个 token | Qwen3.5 9B | |
| 64 GB | GLM-4.7-Flash | 每秒 100+ 个 token | Qwen3.5 9B | |
| 128 GB | Qwen3-Next 80B-A3B | 每秒 96–193 个 token | Qwen3.5 9B | |
M5 Ultra — Mac Studio |
96 GB | gpt-oss-120b | 每秒 92–163 个 token | Qwen3.5 9B |
| 256 GB | Qwen3 235B-A22B | 每秒 28–50 个 token | Qwen3.5 9B | |
| 512 GB | Qwen3 235B-A22B | 每秒 28–50 个 token | Qwen3.5 9B | |
M3 Ultra — Mac Studio |
96 GB | gpt-oss-120b | 每秒 63–90 个 token | Qwen3.5 9B |
| 256 GB | Qwen3 235B-A22B | 每秒 20–28 个 token | Qwen3.5 9B | |
| 512 GB | Qwen3 235B-A22B | 每秒 20–28 个 token | Qwen3.5 9B | |
M4 Max — MacBook Pro, Mac Studio |
36 GB | GLM-4.7-Flash | 每秒 73–106 个 token | Qwen3.5 9B |
| 48 GB | gpt-oss-20b | 每秒 85–122 个 token | Qwen3.5 9B | |
| 64 GB | gpt-oss-20b | 每秒 85–122 个 token | Qwen3.5 9B | |
| 128 GB | Qwen3-Next 80B-A3B | 每秒 53–107 个 token | Qwen3.5 9B | |
M2 Ultra — Mac Studio |
64 GB | gpt-oss-20b | 每秒 89–128 个 token | Qwen3.5 9B |
| 128 GB | gpt-oss-120b | 每秒 63–91 个 token | Qwen3.5 9B | |
| 192 GB | Qwen3 235B-A22B | 每秒 20–28 个 token | Qwen3.5 9B | |
M2 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 每秒 62–90 个 token | Qwen3.5 9B |
| 64 GB | gpt-oss-20b | 每秒 62–90 个 token | Qwen3.5 9B | |
| 96 GB | Qwen3-Next 80B-A3B | 每秒 39–78 个 token | Qwen3.5 9B | |
M1 Ultra — Mac Studio |
64 GB | gpt-oss-20b | 每秒 75–107 个 token | Qwen3.5 9B |
| 128 GB | gpt-oss-120b | 每秒 52–75 个 token | Qwen3.5 9B | |
M1 Max — MacBook Pro, Mac Studio |
32 GB | gpt-oss-20b | 每秒 56–80 个 token | Qwen3.5 9B |
| 64 GB | gpt-oss-20b | 每秒 56–80 个 token | Qwen3.5 9B |
以上为估算值而非实测值,依据 llama.cpp 公开基准测试计算。数据核对于 2026年9月26日。
凭借 128 到 512 GB 的统一内存,Mac Studio 能容纳任何显卡都装不下的模型:gpt-oss-120b、Qwen3.5 122B-A10B,甚至 Qwen3 235B-A22B。
它的 Max 和 Ultra 芯片以 400 GB/s 到 1.2 TB/s 的速度读取内存:混合专家模型每秒可生成几十个 token。
即使满负荷也很安静,长时间使用也能保持速度。
关于在本地运行大模型的问题
Ultra 芯片的 Mac Studio 适合哪个大模型?
256 或 512 GB 时,这里最大的模型 Qwen3 235B-A22B 也能流畅运行;gpt-oss-120b 和 Qwen3.5 122B-A10B 生成更快。
128 GB 够跑 70B 模型吗?
够,而且很流畅:Llama 3.3 70B 在 4 位下约需 48 GB。128 GB 时,gpt-oss-120b 等混合专家模型也装得下。
跑本地大模型,选 Max 还是 Ultra?
Ultra 的内存带宽和内存容量都翻倍:运行大模型时回答更快,还能跑最大的模型。如果模型不超过 70B,Max 就够了。
按电脑分类的最佳本地大模型
Twoody 正处于内测阶段。
支持 Mac、Windows 和 Linux,免费,无需账户,无需订阅;也支持 iPhone 和 Android,配合你电脑上的 Twoody 使用。留下你的电子邮件地址:Twoody 向你开放时,我们会写信通知你。