想玩本地大模型?先把 Ollama 搞明白

2026年4月25日 · 3174 字 · 7 分钟 · DeepSeek-V4 Ollama 本地大模型 AI部署 显卡选型 开源模型

1777129952227

这两天,DeepSeek-V4 Preview 一发布,很多人第一反应都是一样的:

“这么强的开源模型,我能不能直接装到自己电脑上?”

这个问题很实际,也是这段时间大家最关心的一件事。

根据 DeepSeek 官方在 2026-04-24 发布的说明,DeepSeek-V4 Preview 已经正式上线并同步开源,包含:

  • DeepSeek-V4-Pro1.6T total / 49B active
  • DeepSeek-V4-Flash284B total / 13B active
  • 默认支持 1M 上下文

消息一出来,很多人又把注意力放回到“本地部署开源模型”这件事上。

但这里有个常见误区:

模型很强,和你今天就能在自己的电脑上把它稳定跑起来,不是一回事

真正困住大多数人的,通常不是“模型不够先进”,而是这些更现实的问题:

  • 本地环境怎么装
  • 模型怎么拉、怎么切换
  • 我的电脑到底带不带得动
  • 显存不够怎么办
  • 怎么把模型接进自己的脚本和工作流

所以如果你现在想认真开始本地跑开源模型,第一步通常不是直接上超大模型,而是先把 Ollama 这套本地入口搭起来。

它这两年越来越火,原因很简单:它把原本很折腾的一件事,做成了普通人也能上手的流程:

  • 下载
  • 安装
  • 拉模型
  • 运行
  • 用 API 接进自己的工具链

很多人第一次接触本地模型,卡住的并不是“不会装”,而是不知道装完以后怎么选模型、怎么判断电脑带不带得动、怎么把它真正用进工作流。

这篇文章就按一条更实用的路线来讲:

  1. 为什么本地模型第一步适合先学 Ollama
  2. Windows 和 Mac 怎么安装、试跑
  3. 怎么按电脑配置选择模型和调优参数
  4. 怎么用 API 和图形界面把它接进工作流

一句话说清楚

Ollama 不是模型本身,它是一个让你在本地更方便运行模型的工具。

它最大的价值不在参数,而在 门槛低

对于普通用户,它解决的是安装和调用复杂的问题。

对于开发者,它解决的是本地服务化的问题。

你不需要一上来就去研究一堆推理框架、量化格式、依赖环境和底层加速配置。很多常见模型,都可以直接通过一条命令拉下来运行,比如 Llama、Qwen、Mistral、DeepSeek 系列。

这也是为什么 DeepSeek-V4 这次一发,讨论最后还是会绕回 Ollama

DeepSeek-V4 代表的是开源模型已经强到什么程度,Ollama 解决的则是你能不能把模型真正装起来、跑起来、接进工作流。

更关键的是,它支持 本地 API 调用

这意味着它不只是终端里的聊天工具,也可以直接变成你自己的“本地 AI 后端”:

  • 接到笔记应用里
  • 接到 Obsidian、VS Code、Raycast 这类工具里
  • 给自己的脚本、机器人、知识库系统提供推理能力
  • 在内网环境里做一个不出网的 AI 助手

如果你在意隐私、本地可控、调用成本和二次开发效率,Ollama 很适合作为第一套方案。

先装起来

Ollama 的安装路径比较统一。先别纠结大模型,先把“能安装、能拉模型、能对话”这条链路跑通。

Windows 用户可以直接使用官方安装包。装完后打开终端,先看版本:

ollama --version

Mac 用户也可以用官方脚本安装:

curl -fsSL https://ollama.com/install.sh | sh

安装完成后,同样用版本命令验证。只要能正常输出版本号,就说明本地服务基本准备好了。

接下来跑一个模型:

ollama run qwen3:8b

也可以试:

ollama run deepseek-r1

第一次运行会先下载模型文件,之后就可以在本地直接对话。这里先别急着追求最强效果,先确认 本机环境能稳定运行

先按硬件选模型

很多人本地部署失败,不是因为不会装,而是第一步就选错了模型。

正确思路不是“哪个模型最大就跑哪个”,而是“我的机器适合先跑哪个”。模型能不能跑,主要看两件事:

  • 显存或统一内存够不够
  • 你能不能接受它的速度

如果显存不够,系统会把一部分压力转移到内存,能跑是能跑,但速度会明显下降。

下面这张表更适合拿来做第一轮选型。它不是实验室跑分,而是偏实战的经验参考。实际速度还会受模型架构、量化格式、上下文长度和系统配置影响。

显卡/硬件档位典型显存/内存更适合的模型范围本地体验判断适合人群
集显/无独显笔记本共享内存1B-3B能跑轻量任务,适合体验纯入门用户
RTX 3060 Laptop / 4060 Laptop6GB-8GB3B-7B 4-bit对话、总结、基础代码任务可用学生、轻度开发者
RTX 3060 12GB / RTX 4070 12GB12GB7B-14B 4-bit体验比较平衡,属于甜点位大多数个人开发者
RTX 4070 Ti Super / 408016GB13B-20B 量化模型适合更长上下文和更复杂任务进阶用户
RTX 3090 / 409024GB14B-32B,部分 MoE 模型可尝试速度和效果都明显更稳重度本地玩家、工作流用户
双 3090 / 更高显存工作站48GB+32B-70B 量化模型可以认真做多模型和复杂推理专业开发、实验型团队
Apple Silicon 统一内存 16GB16GB3B-7B日常体验不错,安静省电Mac 轻量用户
Apple Silicon 统一内存 32GB+32GB+7B-14B,部分更大模型可尝试本地开发体验很好Mac 开发者、创作者

如果你只想先记一句话,可以记这个:

8GB 左右更适合跑 7B12GB16GB 开始进入“真能用”的区间;24GB 才是很多重度用户真正舒服的起点。

对大多数公众号读者、独立开发者、产品经理来说,日常任务无非是写作润色、文档问答、代码解释、知识库检索和自动化助手。很多 7B14B 的量化模型已经够用了。

Mac 用户可以稍微乐观一点。苹果芯片的统一内存架构对本地模型比较友好,尤其是已经在用 Mac 做开发的人,不一定非得再单独买一台“AI 主机”。如果你的场景是日常写作、知识库问答、代码辅助、轻量 Agent 或本地 API 服务,高配 Mac 的实际体验并不差。

显存不够怎么办

Ollama 默认更偏向单机个人使用。如果你只是自己在终端里聊几句,通常不用改太多配置。

但如果你准备把它接进局域网共享服务、本地工作流、自动化脚本,或者让多个工具同时调用,就要开始关注资源占用和并发能力。

优先级可以这样排:

  1. 先选合适的模型大小
  2. 优先使用量化模型
  3. 缩短不必要的上下文长度
  4. 控制并发请求数量
  5. 减少同时常驻的模型数量

比如你想提高并行请求能力,可以设置:

export OLLAMA_NUM_PARALLEL=4

如果你经常在多个模型之间切换,也可以让少量模型保持加载状态:

export OLLAMA_MAX_LOADED_MODELS=2

但这两个参数都不是越大越好。并发数越高,显存和内存压力越大;常驻模型越多,资源也越容易被吃满。

真实使用里,很多人折腾半天,最后发现把 14B 换成 7B,整体体验反而更好。因为对工作流来说,稳定响应往往比偶尔更聪明更重要

所以不要一上来就把并发开很大,也不要同时挂一堆模型。先固定 1 到 2 个主力模型,把高频任务跑顺,再根据显存、内存和响应时间慢慢调。

接进工作流

很多人把 Ollama 当作“本地聊天工具”,其实只用到了一半。

它更有用的地方在于:你可以把它当成本地 LLM 服务来调用。

比如你可以做这些事情:

  • 写一个本地写作助手
  • 给知识库做问答接口
  • 在 VS Code 插件里接一个私有模型
  • 用脚本批量处理文档、标题、摘要、翻译
  • 做一个只在公司内网运行的 AI 工具

最典型的调用方式,就是通过本地 HTTP API:

curl http://localhost:11434/api/generate -d '{
  "model": "qwen3:8b",
  "prompt": "请帮我总结这段文档的核心观点",
  "stream": false
}'

如果你是开发者,接入脚本也很简单。下面是一个 Python 示例:

import requests

url = "http://localhost:11434/api/generate"
payload = {
    "model": "qwen3:8b",
    "prompt": "请帮我把这段公众号草稿改得更口语化一些",
    "stream": False,
}

resp = requests.post(url, json=payload, timeout=120)
print(resp.json()["response"])

这一层能力很重要。因为当你把它和自己的脚本、知识库、自动化流程连起来之后,它就不只是一个软件,而是一个可复用的底座。

如果你不喜欢终端,也可以把 Ollama 和图形化工具搭配起来用。常见方向包括:

  • Web 对话界面
  • 本地知识库界面
  • 编辑器插件
  • 桌面客户端

很多用户会把 Ollama + 图形界面 作为第一套长期方案。底层用 Ollama 管模型和接口,上层用顺手的界面完成对话、检索、知识管理和工作流调用。后面无论换模型还是换前端,成本都不会太高。

最省心的路线

如果你准备最近开始动手,可以按这个顺序来:

  1. 先安装 Ollama
  2. 3B7B 模型开始,验证“能跑、稳定、会调用”
  3. 再根据电脑配置升级到 7B14B 或更大模型
  4. 尝试本地 API,把它接进脚本、笔记工具或编辑器插件
  5. 最后再考虑并发、多模型常驻和局域网共享

真正决定体验上限的,不只是“有没有装上 Ollama”,还包括你有没有选对模型、按硬件能力做配置,并把它从聊天工具升级成自己的本地 AI 底座。

如果只是想尝鲜,Ollama 已经足够简单;如果你想把本地模型真正用起来,它也有不错的扩展性,能继续往下走。

所以很多人会把它当作本地大模型的默认入口。


如果你也在折腾本地 AI,可以先收藏这篇,后面按自己的电脑配置一步步试。关注我,接下来我会继续写 OllamaLM StudioGPT4AllJan 这些本地工具的差异、选型和实战用法。