想玩本地大模型?先把 Ollama 搞明白
2026年4月25日 · 3174 字 · 7 分钟 · DeepSeek-V4 Ollama 本地大模型 AI部署 显卡选型 开源模型

这两天,DeepSeek-V4 Preview 一发布,很多人第一反应都是一样的:
“这么强的开源模型,我能不能直接装到自己电脑上?”
这个问题很实际,也是这段时间大家最关心的一件事。
根据 DeepSeek 官方在 2026-04-24 发布的说明,DeepSeek-V4 Preview 已经正式上线并同步开源,包含:
DeepSeek-V4-Pro:1.6T total / 49B activeDeepSeek-V4-Flash:284B total / 13B active- 默认支持
1M上下文
消息一出来,很多人又把注意力放回到“本地部署开源模型”这件事上。
但这里有个常见误区:
模型很强,和你今天就能在自己的电脑上把它稳定跑起来,不是一回事。
真正困住大多数人的,通常不是“模型不够先进”,而是这些更现实的问题:
- 本地环境怎么装
- 模型怎么拉、怎么切换
- 我的电脑到底带不带得动
- 显存不够怎么办
- 怎么把模型接进自己的脚本和工作流
所以如果你现在想认真开始本地跑开源模型,第一步通常不是直接上超大模型,而是先把 Ollama 这套本地入口搭起来。
它这两年越来越火,原因很简单:它把原本很折腾的一件事,做成了普通人也能上手的流程:
- 下载
- 安装
- 拉模型
- 运行
- 用 API 接进自己的工具链
很多人第一次接触本地模型,卡住的并不是“不会装”,而是不知道装完以后怎么选模型、怎么判断电脑带不带得动、怎么把它真正用进工作流。
这篇文章就按一条更实用的路线来讲:
- 为什么本地模型第一步适合先学 Ollama
- Windows 和 Mac 怎么安装、试跑
- 怎么按电脑配置选择模型和调优参数
- 怎么用 API 和图形界面把它接进工作流
一句话说清楚
Ollama 不是模型本身,它是一个让你在本地更方便运行模型的工具。
它最大的价值不在参数,而在 门槛低。
对于普通用户,它解决的是安装和调用复杂的问题。
对于开发者,它解决的是本地服务化的问题。
你不需要一上来就去研究一堆推理框架、量化格式、依赖环境和底层加速配置。很多常见模型,都可以直接通过一条命令拉下来运行,比如 Llama、Qwen、Mistral、DeepSeek 系列。
这也是为什么 DeepSeek-V4 这次一发,讨论最后还是会绕回 Ollama。
DeepSeek-V4 代表的是开源模型已经强到什么程度,Ollama 解决的则是你能不能把模型真正装起来、跑起来、接进工作流。
更关键的是,它支持 本地 API 调用。
这意味着它不只是终端里的聊天工具,也可以直接变成你自己的“本地 AI 后端”:
- 接到笔记应用里
- 接到 Obsidian、VS Code、Raycast 这类工具里
- 给自己的脚本、机器人、知识库系统提供推理能力
- 在内网环境里做一个不出网的 AI 助手
如果你在意隐私、本地可控、调用成本和二次开发效率,Ollama 很适合作为第一套方案。
先装起来
Ollama 的安装路径比较统一。先别纠结大模型,先把“能安装、能拉模型、能对话”这条链路跑通。
Windows 用户可以直接使用官方安装包。装完后打开终端,先看版本:
ollama --version
Mac 用户也可以用官方脚本安装:
curl -fsSL https://ollama.com/install.sh | sh
安装完成后,同样用版本命令验证。只要能正常输出版本号,就说明本地服务基本准备好了。
接下来跑一个模型:
ollama run qwen3:8b
也可以试:
ollama run deepseek-r1
第一次运行会先下载模型文件,之后就可以在本地直接对话。这里先别急着追求最强效果,先确认 本机环境能稳定运行。
先按硬件选模型
很多人本地部署失败,不是因为不会装,而是第一步就选错了模型。
正确思路不是“哪个模型最大就跑哪个”,而是“我的机器适合先跑哪个”。模型能不能跑,主要看两件事:
- 显存或统一内存够不够
- 你能不能接受它的速度
如果显存不够,系统会把一部分压力转移到内存,能跑是能跑,但速度会明显下降。
下面这张表更适合拿来做第一轮选型。它不是实验室跑分,而是偏实战的经验参考。实际速度还会受模型架构、量化格式、上下文长度和系统配置影响。
| 显卡/硬件档位 | 典型显存/内存 | 更适合的模型范围 | 本地体验判断 | 适合人群 |
|---|---|---|---|---|
| 集显/无独显笔记本 | 共享内存 | 1B-3B | 能跑轻量任务,适合体验 | 纯入门用户 |
| RTX 3060 Laptop / 4060 Laptop | 6GB-8GB | 3B-7B 4-bit | 对话、总结、基础代码任务可用 | 学生、轻度开发者 |
| RTX 3060 12GB / RTX 4070 12GB | 12GB | 7B-14B 4-bit | 体验比较平衡,属于甜点位 | 大多数个人开发者 |
| RTX 4070 Ti Super / 4080 | 16GB | 13B-20B 量化模型 | 适合更长上下文和更复杂任务 | 进阶用户 |
| RTX 3090 / 4090 | 24GB | 14B-32B,部分 MoE 模型可尝试 | 速度和效果都明显更稳 | 重度本地玩家、工作流用户 |
| 双 3090 / 更高显存工作站 | 48GB+ | 32B-70B 量化模型 | 可以认真做多模型和复杂推理 | 专业开发、实验型团队 |
| Apple Silicon 统一内存 16GB | 16GB | 3B-7B | 日常体验不错,安静省电 | Mac 轻量用户 |
| Apple Silicon 统一内存 32GB+ | 32GB+ | 7B-14B,部分更大模型可尝试 | 本地开发体验很好 | Mac 开发者、创作者 |
如果你只想先记一句话,可以记这个:
8GB 左右更适合跑 7B;12GB 到 16GB 开始进入“真能用”的区间;24GB 才是很多重度用户真正舒服的起点。
对大多数公众号读者、独立开发者、产品经理来说,日常任务无非是写作润色、文档问答、代码解释、知识库检索和自动化助手。很多 7B 到 14B 的量化模型已经够用了。
Mac 用户可以稍微乐观一点。苹果芯片的统一内存架构对本地模型比较友好,尤其是已经在用 Mac 做开发的人,不一定非得再单独买一台“AI 主机”。如果你的场景是日常写作、知识库问答、代码辅助、轻量 Agent 或本地 API 服务,高配 Mac 的实际体验并不差。
显存不够怎么办
Ollama 默认更偏向单机个人使用。如果你只是自己在终端里聊几句,通常不用改太多配置。
但如果你准备把它接进局域网共享服务、本地工作流、自动化脚本,或者让多个工具同时调用,就要开始关注资源占用和并发能力。
优先级可以这样排:
- 先选合适的模型大小
- 优先使用量化模型
- 缩短不必要的上下文长度
- 控制并发请求数量
- 减少同时常驻的模型数量
比如你想提高并行请求能力,可以设置:
export OLLAMA_NUM_PARALLEL=4
如果你经常在多个模型之间切换,也可以让少量模型保持加载状态:
export OLLAMA_MAX_LOADED_MODELS=2
但这两个参数都不是越大越好。并发数越高,显存和内存压力越大;常驻模型越多,资源也越容易被吃满。
真实使用里,很多人折腾半天,最后发现把 14B 换成 7B,整体体验反而更好。因为对工作流来说,稳定响应往往比偶尔更聪明更重要。
所以不要一上来就把并发开很大,也不要同时挂一堆模型。先固定 1 到 2 个主力模型,把高频任务跑顺,再根据显存、内存和响应时间慢慢调。
接进工作流
很多人把 Ollama 当作“本地聊天工具”,其实只用到了一半。
它更有用的地方在于:你可以把它当成本地 LLM 服务来调用。
比如你可以做这些事情:
- 写一个本地写作助手
- 给知识库做问答接口
- 在 VS Code 插件里接一个私有模型
- 用脚本批量处理文档、标题、摘要、翻译
- 做一个只在公司内网运行的 AI 工具
最典型的调用方式,就是通过本地 HTTP API:
curl http://localhost:11434/api/generate -d '{
"model": "qwen3:8b",
"prompt": "请帮我总结这段文档的核心观点",
"stream": false
}'
如果你是开发者,接入脚本也很简单。下面是一个 Python 示例:
import requests
url = "http://localhost:11434/api/generate"
payload = {
"model": "qwen3:8b",
"prompt": "请帮我把这段公众号草稿改得更口语化一些",
"stream": False,
}
resp = requests.post(url, json=payload, timeout=120)
print(resp.json()["response"])
这一层能力很重要。因为当你把它和自己的脚本、知识库、自动化流程连起来之后,它就不只是一个软件,而是一个可复用的底座。
如果你不喜欢终端,也可以把 Ollama 和图形化工具搭配起来用。常见方向包括:
- Web 对话界面
- 本地知识库界面
- 编辑器插件
- 桌面客户端
很多用户会把 Ollama + 图形界面 作为第一套长期方案。底层用 Ollama 管模型和接口,上层用顺手的界面完成对话、检索、知识管理和工作流调用。后面无论换模型还是换前端,成本都不会太高。
最省心的路线
如果你准备最近开始动手,可以按这个顺序来:
- 先安装 Ollama
- 从
3B或7B模型开始,验证“能跑、稳定、会调用” - 再根据电脑配置升级到
7B、14B或更大模型 - 尝试本地 API,把它接进脚本、笔记工具或编辑器插件
- 最后再考虑并发、多模型常驻和局域网共享
真正决定体验上限的,不只是“有没有装上 Ollama”,还包括你有没有选对模型、按硬件能力做配置,并把它从聊天工具升级成自己的本地 AI 底座。
如果只是想尝鲜,Ollama 已经足够简单;如果你想把本地模型真正用起来,它也有不错的扩展性,能继续往下走。
所以很多人会把它当作本地大模型的默认入口。
如果你也在折腾本地 AI,可以先收藏这篇,后面按自己的电脑配置一步步试。关注我,接下来我会继续写 Ollama、LM Studio、GPT4All、Jan 这些本地工具的差异、选型和实战用法。