本地 AI 部署入门:在自己电脑上跑一个大模型

在自己电脑上跑大模型其实没那么难,难的是搞清楚你的硬件到底能跑多大的模型,以及别对速度抱不切实际的期待。

在自己电脑上跑大模型其实没那么难,难的是搞清楚你的硬件到底能跑多大的模型,以及别对速度抱不切实际的期待。

去年我第一次在本地跑起来一个 7B 模型的时候,心情挺复杂的。一方面确实有点震撼:断网、不花钱、数据不出本机,它就能跟我对话。另一方面也有点失落:回答速度比在线服务慢,而且明显更笨。

折腾了几个月,我大概摸清楚了本地部署的能力边界。这篇文章写给想入门的人:不吹「替代在线服务」,也不劝退,就是把真实的硬件需求、工具选型和量化知识讲清楚,让你能自己做判断。


🎯 先想清楚:为什么要跑本地

本地跑模型不是没有代价的,所以在动手之前,值得先确认你的动机是真的:

  • 隐私:处理的是合同、病历、内部代码这类不能上传的内容。这是最硬的理由。
  • 成本:长期高频使用,本地电费可能比 API 调用便宜(但硬件投入是门槛)。
  • 离线:在没网或者网络受限的环境里工作。
  • 可控:可以自由微调、改系统提示词、接自己的工具链。

如果你的需求只是「帮我写个邮件、改改文案」,在线服务几乎总是更划算。本地部署的意义在于隐私控制和离线可用,不在于免费的智商。

🧰 两个主要工具:Ollama 和 LM Studio

Ollama:命令行优先,适合技术用户

Ollama 是目前最省事的方式:装好之后,一行命令下载并运行模型。它自带一个本地服务端口,其他程序(比如写代码的插件、聊天前端)可以通过 API 调用它。

# 下载并运行一个模型
ollama run qwen2.5:7b

# 查看本地已有的模型
ollama list

# 查看正在运行的模型
ollama ps

Ollama 的优势是自动化程度高:它自动处理量化版本选择、自动分配显存和内存、自动启停。也提供了 OpenAI 兼容的接口,很多现成的工具可以直接对接,不用改代码。跨平台支持 Windows、macOS、Linux。

它的短板是配置的细粒度不如专业推理框架,比如你想自定义上下文长度、调整批处理大小,就得去改环境变量或者配置文件,不如图形界面直观。

LM Studio:图形界面,适合不折腾的人

LM Studio 是一个桌面应用,界面像个聊天软件:左边选模型、右边聊天,还能直接在界面上看到当前跑得动什么、什么模型会溢出到内存。它内置了模型市场,搜索、下载、切换模型全程图形化,零命令行。

它还有一个很实用的功能:加载模型前会评估你的硬件,告诉你这个模型能不能全放进显存。对新手来说,这比对着显存容量瞎猜有用得多。它也提供本地 API 服务,能作为后端给别的软件用。

🧮 显存到底需要多少:一个能心算的公式

这是整篇文章最重要的一节。本地部署最大的瓶颈不是算力,是显存不够导致模型跑在内存里,速度会掉十倍以上。

粗略的估算公式是:所需显存 ≈ 参数量 × 每参数字节数 + 上下文开销。这里的「每参数字节数」由量化等级决定。

量化等级每参数约占比特7B 模型占用质量损失
FP16(未量化)16 bit约 14 GB基准,无损失
Q8_0约 8.5 bit约 7.5 GB几乎无感
Q5_K_M约 5.5 bit约 5 GB极小
Q4_K_M约 4.8 bit约 4.4 GB轻微,性价比最高
Q3_K_M约 3.9 bit约 3.5 GB可感知,慎用
Q2_K约 2.6 bit约 2.5 GB明显变笨

实战中最省心的选择是 Q4_K_M:体积比 Q8 小一大截,但质量下降通常很小,社区里几乎所有硬件的推荐配置都会提到它。量化不是简单地「越小越差」,关键是找到你显存能容纳、又不至于明显降智的那个档位。

除了模型本身,还要留出上下文缓存(KV Cache)的空间。上下文越长,这块开销越大。8K 上下文的开销和 32K 上下文完全不是一个量级。所以显存要留出余量,大概比模型体积多 1-2GB 比较稳妥。

💻 按显存容量看能跑什么

显存典型硬件舒服运行勉强能跑
8 GBRTX 4060 / 3060Ti7B Q413B Q4(需省上下文)
12 GBRTX 3060 12G / 407013B Q420B 级别的 Q4
16 GBRTX 4060Ti 16G / 408014B Q5、部分 30B Q332B Q4
24 GBRTX 3090 / 409032B Q4、部分 70B 高压缩70B Q2
无独显 / 核显笔记本集显3B-7B Q4(速度较慢)——

几个必须知道的现实:

  • Apple Silicon(M 系列)是统一内存架构,内存可以直接给 GPU 用,所以一台 32GB 内存的 Mac 能跑 32B 级别的模型,这在同价位的独显机器上很难做到。代价是推理速度不如高端独显。
  • 显存不够时会溢出到内存,能跑但很慢,可能一秒出个字。如果只是偶尔用,忍一忍也行;如果要天天用,体验会很糟。
  • CPU 推理是可行的,只是速度差一个数量级,而且会吃满内存带宽。

📦 模型怎么选:别只盯着参数量

参数量大不等于好用。7B 模型在小显存机器上跑起来,体验往往好过 70B 模型在内存里爬。实际选择时看三个维度:

  1. 规模:从你显存能舒舒服服容纳的规模往上试,别硬撑。
  2. 用途:通用对话、写代码、翻译、长文档理解,不同模型擅长的不一样,同一个参数量级下差异很明显。
  3. 上下文长度:要处理长文档就得选支持长上下文的,但记住上下文越长占显存越多。

另外,社区里经过指令微调的版本通常比原始基座模型好用得多——同样规模,微调过的版本在对话和遵从指令上差距很大。下载时优先选择带指令微调标注的版本。

⚠️ 踩过的几个坑

第一,磁盘空间被吃掉。一个 7B 的 Q4 模型大约 4-5GB,但你可能同时会下载好几个版本对比,很容易占掉一百多 G。装之前先规划一下模型存放目录。

第二,第一次运行的下载速度。模型体积大,网络不稳的话下载会反复中断。先确认存储路径和网络,再开始下载。

第三,别指望它做复杂推理。本地能跑的规模,在数学、多步推理、长链条逻辑上明显弱于顶级在线模型。把它定位成「隐私场景下的助手」和「本地文档的粗加工工具」更现实。

📌 小结

入门路径我建议这样走:先装 LM Studio 图形界面,下载一个 7B 的 Q4 模型体验一下,感受一下速度和质量。如果觉得可用,再考虑迁移到 Ollama 做自动化和 API 集成。硬件上,8GB 显存是能玩的起点,12-16GB 是比较舒服的区间。

最后要说的是心态:本地部署最大的价值是确定性和隐私——你的数据不出这台机器。如果你清楚这一点,并且接受它在能力上的局限,那么在自己电脑上跑一个模型,确实是件挺有意思的事。


如果只是想试试,今天就下个 7B 的 Q4 版本。跑通的那一刻,你会对「AI 到底是怎么工作的」有一层新的理解。

给TA加油
共{{data.count}}人
人已加油
0 条回复 A文章作者M管理员
    暂无讨论,说说你的看法吧
个人中心
购物车
优惠劵
今日签到
有新私信私信列表
搜索
-->