本地大模型计算器
适合你的 MacBook Air 的最佳本地大模型
从 M1 到 M5,8 到 32 GB 内存:每款 MacBook Air 能流畅运行的最强模型,以及它的生成速度。
| 你的电脑 | 内存 | 推荐:运行流畅 | 生成速度 | 在 Twoody 中一键安装 |
|---|---|---|---|---|
M5 — MacBook Air, MacBook Pro |
16 GB | Llama 3.1 8B | 每秒 20–28 个 token | Qwen3.5 9B |
| 24 GB | gpt-oss-20b | 每秒 32–47 个 token | Qwen3.5 9B | |
| 32 GB | GLM-4.7-Flash | 每秒 41–59 个 token | Qwen3.5 9B | |
M4 — MacBook Air, MacBook Pro, Mac mini, iMac |
16 GB | Llama 3.1 8B | 每秒 15–22 个 token | Qwen3.5 9B |
| 24 GB | gpt-oss-20b | 每秒 25–36 个 token | Qwen3.5 9B | |
| 32 GB | GLM-4.7-Flash | 每秒 32–46 个 token | Qwen3.5 9B | |
M3 — MacBook Air, MacBook Pro, iMac |
8 GB | Llama 3.2 3B | 每秒 31–45 个 token | Qwen3.5 4B |
| 16 GB | Llama 3.1 8B | 每秒 13–19 个 token | Qwen3.5 9B | |
| 24 GB | gpt-oss-20b | 每秒 23–32 个 token | Qwen3.5 9B | |
M2 — MacBook Air, MacBook Pro, Mac mini |
8 GB | Llama 3.2 3B | 每秒 32–45 个 token | Qwen3.5 4B |
| 16 GB | Llama 3.1 8B | 每秒 13–19 个 token | Qwen3.5 9B | |
| 24 GB | gpt-oss-20b | 每秒 23–33 个 token | Qwen3.5 9B | |
M1 — MacBook Air, MacBook Pro, Mac mini, iMac |
8 GB | Llama 3.2 3B | 每秒 20–29 个 token | Qwen3.5 4B |
| 16 GB | Llama 3.1 8B | 每秒 8.9–13 个 token | Qwen3.5 9B |
以上为估算值而非实测值,依据 llama.cpp 公开基准测试计算。数据核对于 2026年9月26日。
MacBook Air 的处理器和图形处理器共享内存。16 GB 时,80 亿参数的模型还能给其他应用留出空间;8 GB 时,建议停留在 40 亿参数左右。
速度取决于芯片的内存带宽:每一代生成都更快,而 M5 读文档的速度比之前的芯片快好几倍。
由于没有风扇,MacBook Air 在连续工作几分钟后会降速:正常长度的回答没问题,长时间使用则稍逊。
关于在本地运行大模型的问题
16 GB 的 MacBook Air M4 适合哪个大模型?
Qwen3.5 9B 或 Qwen3 8B:它们运行流畅,每秒约生成 15 到 21 个 token。Twoody 一键安装 Qwen3.5 9B。
8 GB 的 MacBook Air 能运行本地大模型吗?
可以,40 亿参数左右的模型,比如 Twoody 在这类 Mac 上安装的 Qwen3.5 4B。使用时请关闭占用资源较多的应用。
运行本地大模型会让 MacBook Air 太热吗?
它会降速而不是过热:由于没有风扇,连续生成几分钟后它会降低速度。日常提问时察觉不到。
按电脑分类的最佳本地大模型
Twoody 正处于内测阶段。
支持 Mac、Windows 和 Linux,免费,无需账户,无需订阅;也支持 iPhone 和 Android,配合你电脑上的 Twoody 使用。留下你的电子邮件地址:Twoody 向你开放时,我们会写信通知你。