在 Windows 上运行本地大模型
在你的 Windows PC 上本地运行大模型
大语言模型可以完全在你的 Windows PC 上运行:私密、离线、免费。下面介绍你需要什么、该选哪个模型、用显卡还是处理器,以及最简单的上手方法。
为什么要在 PC 上运行大模型
模型在这台 PC 上回答问题、阅读你的文件。没有网络也能用。没有订阅,没有用量限制,也无需账户。代价是:能装进 PC 的模型比最大的在线模型小——写作、总结和处理你的文档都很出色,但最难的推理就稍逊一筹。
你需要什么
64 位 Windows 10 或 11。有两种内存要考虑。用处理器运行时,由电脑的内存(RAM)决定:约 40 亿参数需要 8 GB,80 亿参数需要 16 GB,140 亿参数需要 24 GB。用显卡运行时,由显卡自身的显存(VRAM)决定:40 亿到 80 亿参数的模型需要 8 GB,140 亿参数或 gpt-oss-20b 需要 16 GB,320 亿参数需要 24 到 32 GB。能完全装进显卡的模型,生成速度远快于在处理器上运行。
该选哪个模型
Qwen3.5 在各种尺寸下都能用多种语言写得很好;Llama、Gemma、Mistral 和 gpt-oss 也是不错的选择。有显卡时,选择能完全装进显存的模型:溢出到电脑内存的模型会慢很多。没有显卡时,就用约 40 亿参数的小模型。
三种方法
- Twoody——与 Mac 上相同的应用:为你的 PC 推荐合适的模型并一键安装,阅读你的文档文件夹并注明出处。安装程序由 Osmove 签名;驱动程序支持时,模型通过 Vulkan 在显卡上运行,否则在处理器上运行。
- LM Studio——一款可以探索数千个模型及其设置的应用。需要处理器支持 AVX2 的 x64 PC,或 ARM PC(Snapdragon X Elite);建议 16 GB 内存。
- Ollama——一个通过终端、API 或其应用使用的引擎。需要 Windows 10 22H2 或更高版本;支持 NVIDIA 显卡,并通过 ROCm 或 Vulkan 支持 AMD Radeon 显卡。
与 Mac 版有何不同
这是同一款应用,对话和文档都一样。有三项功能仅限 Mac:读取扫描版 PDF、“通讯录”和“日历”,以及使用 macOS 语音识别的听写——在 Windows 上,你的语音由应用自带的 whisper.cpp 在 PC 上转写。与 Mac 上一样,Twoody 会在你点击确认后自动更新。
用 Twoody,只需三步
-
1
加入候补名单:Twoody 目前处于内测阶段,Windows 版和 Mac、Linux 版都是如此;向你开放时,我们会写信通知你。
-
2
安装它为你的 PC 推荐的模型:2.8 GB 或 5.8 GB,一键完成。
-
3
提出你的第一个问题——愿意的话,可以关掉 Wi-Fi 试试。
常见问题
在 Windows 上本地运行大模型免费吗?
免费:开放权重的模型可以免费下载,Twoody、LM Studio 和 Ollama 也都免费。唯一的成本是 PC 的内存和电费。
我需要显卡吗?
不需要,但有显卡会快很多。没有显卡时,模型在处理器上运行:小模型可以用,只是更慢。驱动程序支持时,Twoody 会通过 Vulkan 使用显卡;LM Studio 和 Ollama 也支持 NVIDIA 和 AMD 显卡。
在 Windows 上运行大模型需要多少内存?
Qwen3.5 4B 这样的小模型需要 8 GB,Qwen3.5 9B 需要 16 GB。有显卡时,由显存(VRAM)决定:40 亿到 80 亿参数的模型需要 8 GB,140 亿参数需要 16 GB。计算器会显示每块显卡能运行哪些模型,以及运行速度。
Windows 提示“Windows 已保护你的电脑”:这正常吗?
正常,新应用在建立信誉之前都会这样,即使已经签名。先确认安装程序由 Osmove 签名(属性 › 数字签名),然后点击“更多信息”,再点击“仍要运行”。
现在能在 Windows 上用 Twoody 吗?
在内测中可以:Twoody 可在 Windows 10 和 11(64 位)上运行,与在 Mac 和 Linux 上一样。下载仅向内测用户开放:留下邮箱即可加入候补名单。
Twoody 正处于内测阶段。
支持 Mac、Windows 和 Linux,免费,无需账户,无需订阅;也支持 iPhone 和 Android,配合你电脑上的 Twoody 使用。留下你的电子邮件地址:Twoody 向你开放时,我们会写信通知你。