在 Linux 上运行本地大模型
在 Linux 上本地运行大模型
大语言模型可以完全在你的 Linux 机器上运行:私密、离线、免费。下面介绍你需要什么、该选哪个模型,以及用 AppImage 或 .deb 软件包最简单的上手方法。
为什么要在自己的机器上运行大模型
模型在这台机器上回答问题、阅读你的文件。没有网络也能用。没有订阅,没有用量限制,也无需账户。代价是:能装进个人电脑的模型比最大的在线模型小——写作、总结和处理你的文档都很出色,但最难的推理就稍逊一筹。
你需要什么
一台运行 Linux 的 x86_64 PC。用处理器运行时,由电脑的内存(RAM)决定:约 40 亿参数需要 8 GB,80 亿参数需要 16 GB,140 亿参数需要 24 GB。内存速度很重要:DDR5 比 DDR4 生成得更快。NVIDIA 或 AMD 显卡配合能在 Linux 上使用它的工具,会快很多。
该选哪个模型
Qwen3.5 在各种尺寸下都能用多种语言写得很好;Llama、Gemma、Mistral 和 gpt-oss 也是不错的选择。用处理器运行时,就用约 40 亿到 90 亿参数的小模型:更大的模型虽然装得进内存,但生成太慢,用起来不舒服。
三种方法
- Twoody——与 Mac 和 Windows 上相同的应用:为你的机器推荐合适的模型并一键安装,阅读你的文档文件夹并注明出处。提供 AppImage 或 .deb 软件包,已在 Ubuntu 24.04 上测试;模型在处理器上运行。
- LM Studio——一款可以探索数千个模型及其设置的应用。提供 AppImage,适用于 Ubuntu 20.04 或更高版本,支持 x64(需 AVX2)和 ARM64。
- Ollama——一个通过终端或其 API 使用的引擎,一条命令即可安装。支持 NVIDIA 显卡(CUDA)和 AMD 显卡(ROCm)。
与 Mac 和 Windows 版有何不同
这是同一款应用,对话和文档都一样。在 Linux 上,模型在处理器上运行:Twoody 在 Linux 上不使用显卡。目前需要手动更新:新版本要你自己下载。另外有三项功能仅限 Mac:读取扫描版 PDF、“通讯录”和“日历”,以及使用 macOS 语音识别的听写——在 Linux 上,你的语音由应用自带的 whisper.cpp 在本机转写。
用 Twoody,只需三步
-
1
加入候补名单:Twoody 目前处于内测阶段,Linux 版和 Mac、Windows 版都是如此;向你开放时,我们会写信通知你。
-
2
安装它为你的机器推荐的模型:2.8 GB 或 5.8 GB,一键完成。
-
3
提出你的第一个问题——愿意的话,可以关掉 Wi-Fi 试试。
常见问题
在 Linux 上本地运行大模型免费吗?
免费:开放权重的模型可以免费下载,Twoody、LM Studio 和 Ollama 也都免费。唯一的成本是机器的内存和电费。
Twoody 在 Linux 上使用显卡吗?
不使用:在 Linux 上,Twoody 用处理器运行模型。如果想用 NVIDIA 或 AMD 显卡,Ollama 和 LM Studio 在 Linux 上可以做到,Twoody 也能使用它们运行的模型。
Twoody 能在哪些发行版上运行?
Twoody 已在 Ubuntu 24.04(x86_64)上测试。AppImage 可在大多数发行版上运行;.deb 软件包可将 Twoody 安装到 Debian、Ubuntu 及其衍生发行版上。
在 Linux 上运行大模型需要多少内存?
Qwen3.5 4B 这样的小模型需要 8 GB,Qwen3.5 9B 需要 16 GB。计算器会显示一台没有显卡、配备 DDR4 或 DDR5 内存的 PC 能运行哪些模型,以及运行速度。
现在能在 Linux 上用 Twoody 吗?
在内测中可以:Twoody 可在 Linux(x86_64)上运行,与在 Mac 和 Windows 上一样。下载仅向内测用户开放:留下邮箱即可加入候补名单。
Twoody 正处于内测阶段。
支持 Mac、Windows 和 Linux,免费,无需账户,无需订阅;也支持 iPhone 和 Android,配合你电脑上的 Twoody 使用。留下你的电子邮件地址:Twoody 向你开放时,我们会写信通知你。