在自己电脑上跑大模型其实没那么难,难的是搞清楚你的硬件到底能跑多大的模型,以及别对速度抱不切实际的期待。
去年我第一次在本地跑起来一个 7B 模型的时候,心情挺复杂的。一方面确实有点震撼:断网、不花钱、数据不出本机,它就能跟我对话。另一方面也有点失落:回答速度比在线服务慢,而且明显更笨。
折腾了几个月,我大概摸清楚了本地部署的能力边界。这篇文章写给想入门的人:不吹「替代在线服务」,也不劝退,就是把真实的硬件需求、工具选型和量化知识讲清楚,让你能自己做判断。
🎯 先想清楚:为什么要跑本地
本地跑模型不是没有代价的,所以在动手之前,值得先确认你的动机是真的:
- 隐私:处理的是合同、病历、内部代码这类不能上传的内容。这是最硬的理由。
- 成本:长期高频使用,本地电费可能比 API 调用便宜(但硬件投入是门槛)。
- 离线:在没网或者网络受限的环境里工作。
- 可控:可以自由微调、改系统提示词、接自己的工具链。
如果你的需求只是「帮我写个邮件、改改文案」,在线服务几乎总是更划算。本地部署的意义在于隐私控制和离线可用,不在于免费的智商。
🧰 两个主要工具:Ollama 和 LM Studio
Ollama:命令行优先,适合技术用户
Ollama 是目前最省事的方式:装好之后,一行命令下载并运行模型。它自带一个本地服务端口,其他程序(比如写代码的插件、聊天前端)可以通过 API 调用它。
# 下载并运行一个模型
ollama run qwen2.5:7b
# 查看本地已有的模型
ollama list
# 查看正在运行的模型
ollama psOllama 的优势是自动化程度高:它自动处理量化版本选择、自动分配显存和内存、自动启停。也提供了 OpenAI 兼容的接口,很多现成的工具可以直接对接,不用改代码。跨平台支持 Windows、macOS、Linux。
它的短板是配置的细粒度不如专业推理框架,比如你想自定义上下文长度、调整批处理大小,就得去改环境变量或者配置文件,不如图形界面直观。
LM Studio:图形界面,适合不折腾的人
LM Studio 是一个桌面应用,界面像个聊天软件:左边选模型、右边聊天,还能直接在界面上看到当前跑得动什么、什么模型会溢出到内存。它内置了模型市场,搜索、下载、切换模型全程图形化,零命令行。
它还有一个很实用的功能:加载模型前会评估你的硬件,告诉你这个模型能不能全放进显存。对新手来说,这比对着显存容量瞎猜有用得多。它也提供本地 API 服务,能作为后端给别的软件用。
🧮 显存到底需要多少:一个能心算的公式
这是整篇文章最重要的一节。本地部署最大的瓶颈不是算力,是显存不够导致模型跑在内存里,速度会掉十倍以上。
粗略的估算公式是:所需显存 ≈ 参数量 × 每参数字节数 + 上下文开销。这里的「每参数字节数」由量化等级决定。
| 量化等级 | 每参数约占比特 | 7B 模型占用 | 质量损失 |
| FP16(未量化) | 16 bit | 约 14 GB | 基准,无损失 |
| Q8_0 | 约 8.5 bit | 约 7.5 GB | 几乎无感 |
| Q5_K_M | 约 5.5 bit | 约 5 GB | 极小 |
| Q4_K_M | 约 4.8 bit | 约 4.4 GB | 轻微,性价比最高 |
| Q3_K_M | 约 3.9 bit | 约 3.5 GB | 可感知,慎用 |
| Q2_K | 约 2.6 bit | 约 2.5 GB | 明显变笨 |
实战中最省心的选择是 Q4_K_M:体积比 Q8 小一大截,但质量下降通常很小,社区里几乎所有硬件的推荐配置都会提到它。量化不是简单地「越小越差」,关键是找到你显存能容纳、又不至于明显降智的那个档位。
除了模型本身,还要留出上下文缓存(KV Cache)的空间。上下文越长,这块开销越大。8K 上下文的开销和 32K 上下文完全不是一个量级。所以显存要留出余量,大概比模型体积多 1-2GB 比较稳妥。
💻 按显存容量看能跑什么
| 显存 | 典型硬件 | 舒服运行 | 勉强能跑 |
| 8 GB | RTX 4060 / 3060Ti | 7B Q4 | 13B Q4(需省上下文) |
| 12 GB | RTX 3060 12G / 4070 | 13B Q4 | 20B 级别的 Q4 |
| 16 GB | RTX 4060Ti 16G / 4080 | 14B Q5、部分 30B Q3 | 32B Q4 |
| 24 GB | RTX 3090 / 4090 | 32B Q4、部分 70B 高压缩 | 70B Q2 |
| 无独显 / 核显 | 笔记本集显 | 3B-7B Q4(速度较慢) | —— |
几个必须知道的现实:
- Apple Silicon(M 系列)是统一内存架构,内存可以直接给 GPU 用,所以一台 32GB 内存的 Mac 能跑 32B 级别的模型,这在同价位的独显机器上很难做到。代价是推理速度不如高端独显。
- 显存不够时会溢出到内存,能跑但很慢,可能一秒出个字。如果只是偶尔用,忍一忍也行;如果要天天用,体验会很糟。
- CPU 推理是可行的,只是速度差一个数量级,而且会吃满内存带宽。
📦 模型怎么选:别只盯着参数量
参数量大不等于好用。7B 模型在小显存机器上跑起来,体验往往好过 70B 模型在内存里爬。实际选择时看三个维度:
- 规模:从你显存能舒舒服服容纳的规模往上试,别硬撑。
- 用途:通用对话、写代码、翻译、长文档理解,不同模型擅长的不一样,同一个参数量级下差异很明显。
- 上下文长度:要处理长文档就得选支持长上下文的,但记住上下文越长占显存越多。
另外,社区里经过指令微调的版本通常比原始基座模型好用得多——同样规模,微调过的版本在对话和遵从指令上差距很大。下载时优先选择带指令微调标注的版本。
⚠️ 踩过的几个坑
第一,磁盘空间被吃掉。一个 7B 的 Q4 模型大约 4-5GB,但你可能同时会下载好几个版本对比,很容易占掉一百多 G。装之前先规划一下模型存放目录。
第二,第一次运行的下载速度。模型体积大,网络不稳的话下载会反复中断。先确认存储路径和网络,再开始下载。
第三,别指望它做复杂推理。本地能跑的规模,在数学、多步推理、长链条逻辑上明显弱于顶级在线模型。把它定位成「隐私场景下的助手」和「本地文档的粗加工工具」更现实。
📌 小结
入门路径我建议这样走:先装 LM Studio 图形界面,下载一个 7B 的 Q4 模型体验一下,感受一下速度和质量。如果觉得可用,再考虑迁移到 Ollama 做自动化和 API 集成。硬件上,8GB 显存是能玩的起点,12-16GB 是比较舒服的区间。
最后要说的是心态:本地部署最大的价值是确定性和隐私——你的数据不出这台机器。如果你清楚这一点,并且接受它在能力上的局限,那么在自己电脑上跑一个模型,确实是件挺有意思的事。
如果只是想试试,今天就下个 7B 的 Q4 版本。跑通的那一刻,你会对「AI 到底是怎么工作的」有一层新的理解。