Twoody

本地大模型计算器

适合你的 Mac Studio 的最佳本地大模型

从 M1 Max 到 512 GB 的 M5 Ultra:Mac 能容纳的最大模型,以及它们的生成速度。

你的电脑 内存 推荐:运行流畅 生成速度 在 Twoody 中一键安装

M5 Max — MacBook Pro, Mac Studio

36 GB GLM-4.7-Flash 每秒 100+ 个 token Qwen3.5 9B
48 GB GLM-4.7-Flash 每秒 100+ 个 token Qwen3.5 9B
64 GB GLM-4.7-Flash 每秒 100+ 个 token Qwen3.5 9B
128 GB Qwen3-Next 80B-A3B 每秒 96–193 个 token Qwen3.5 9B

M5 Ultra — Mac Studio

96 GB gpt-oss-120b 每秒 92–163 个 token Qwen3.5 9B
256 GB Qwen3 235B-A22B 每秒 28–50 个 token Qwen3.5 9B
512 GB Qwen3 235B-A22B 每秒 28–50 个 token Qwen3.5 9B

M3 Ultra — Mac Studio

96 GB gpt-oss-120b 每秒 63–90 个 token Qwen3.5 9B
256 GB Qwen3 235B-A22B 每秒 20–28 个 token Qwen3.5 9B
512 GB Qwen3 235B-A22B 每秒 20–28 个 token Qwen3.5 9B

M4 Max — MacBook Pro, Mac Studio

36 GB GLM-4.7-Flash 每秒 73–106 个 token Qwen3.5 9B
48 GB gpt-oss-20b 每秒 85–122 个 token Qwen3.5 9B
64 GB gpt-oss-20b 每秒 85–122 个 token Qwen3.5 9B
128 GB Qwen3-Next 80B-A3B 每秒 53–107 个 token Qwen3.5 9B

M2 Ultra — Mac Studio

64 GB gpt-oss-20b 每秒 89–128 个 token Qwen3.5 9B
128 GB gpt-oss-120b 每秒 63–91 个 token Qwen3.5 9B
192 GB Qwen3 235B-A22B 每秒 20–28 个 token Qwen3.5 9B

M2 Max — MacBook Pro, Mac Studio

32 GB gpt-oss-20b 每秒 62–90 个 token Qwen3.5 9B
64 GB gpt-oss-20b 每秒 62–90 个 token Qwen3.5 9B
96 GB Qwen3-Next 80B-A3B 每秒 39–78 个 token Qwen3.5 9B

M1 Ultra — Mac Studio

64 GB gpt-oss-20b 每秒 75–107 个 token Qwen3.5 9B
128 GB gpt-oss-120b 每秒 52–75 个 token Qwen3.5 9B

M1 Max — MacBook Pro, Mac Studio

32 GB gpt-oss-20b 每秒 56–80 个 token Qwen3.5 9B
64 GB gpt-oss-20b 每秒 56–80 个 token Qwen3.5 9B

以上为估算值而非实测值,依据 llama.cpp 公开基准测试计算。数据核对于 2026年9月26日。

凭借 128 到 512 GB 的统一内存,Mac Studio 能容纳任何显卡都装不下的模型:gpt-oss-120b、Qwen3.5 122B-A10B,甚至 Qwen3 235B-A22B。

它的 Max 和 Ultra 芯片以 400 GB/s 到 1.2 TB/s 的速度读取内存:混合专家模型每秒可生成几十个 token。

即使满负荷也很安静,长时间使用也能保持速度。

关于在本地运行大模型的问题

Ultra 芯片的 Mac Studio 适合哪个大模型?

256 或 512 GB 时,这里最大的模型 Qwen3 235B-A22B 也能流畅运行;gpt-oss-120b 和 Qwen3.5 122B-A10B 生成更快。

128 GB 够跑 70B 模型吗?

够,而且很流畅:Llama 3.3 70B 在 4 位下约需 48 GB。128 GB 时,gpt-oss-120b 等混合专家模型也装得下。

跑本地大模型,选 Max 还是 Ultra?

Ultra 的内存带宽和内存容量都翻倍:运行大模型时回答更快,还能跑最大的模型。如果模型不超过 70B,Max 就够了。

按电脑分类的最佳本地大模型

Twoody 正处于内测阶段。

支持 Mac、Windows 和 Linux,免费,无需账户,无需订阅;也支持 iPhone 和 Android,配合你电脑上的 Twoody 使用。留下你的电子邮件地址:Twoody 向你开放时,我们会写信通知你。