ChatGPT、Claude、Gemini——三个AI助手轮流涨价。
OpenAI的GPT-5 API每百万token的价格已经让中小团队开始肉疼。Claude虽然降了价,但用了几个月后账单上的数字还是让你倒吸一口凉气。你开始想:能不能把大模型跑在自己的电脑上,不联网,不付费,不限次数?
答案是一个叫 Ollama 的开源工具。
它只有约 17MB,安装之后你就能在你的笔记本上运行 DeepSeek、Llama、Qwen、Mistral 等数十个主流开源大模型——完全不联网,完全免费,数据完全不离开你的硬盘。
我刚用一台 32GB 内存的 MacBook Pro 跑了一个月,这篇文章把安装、配置、使用、调优的全部经验拆给你看。

第一步:安装 Ollama(5分钟搞定)
Ollama 支持 macOS、Windows、Linux 三大平台。
macOS:
# 下载官方安装包# 访问 https://ollama.com/download 下载 .dmg 文件# 双击安装,拖入 Applications 文件夹即可
或者用 Homebrew 一键安装:
brew install ollama
Windows:
# 访问 https://ollama.com/download/windows# 下载 OllamaSetup.exe,双击运行# 安装完成后系统托盘会出现羊驼图标
Linux(推荐脚本安装):
curl -fsSL https://ollama.com/install.sh | sh
安装完成后验证:
ollama --version# 输出类似:ollama version 0.6.x
安装即用,不需要 Docker,不需要 CUDA 环境配置,不需要 Python 虚拟环境。 这是 Ollama 最核心的优势——它把大模型运行的门槛降到了"安装一个普通软件"的级别。
第二步:拉取你的第一个模型(3分钟跑通)
Ollama 内置了一个模型库,直接用 ollama pull 命令下载:
# 拉取 DeepSeek-R1 蒸馏版(推荐入门,速度快)ollama pull deepseek-r1:14b# 拉取 Llama 3.1(8B版本,轻量通用)ollama pull llama3.1:8b# 拉取 Qwen 2.5(对中文最友好)ollama pull qwen2.5:14b# 拉取 Mistral(代码能力强)ollama pull mistral:7b# 拉取国产 DeepSeek-V3 轻量版ollama pull deepseek-v3:8b
下载完成后直接运行模型对话:
ollama run deepseek-r1:14b
终端里直接出现对话界面,输入问题,模型实时回复。不需要写一行代码,不需要配 API Key。

第三步:模型选型指南(一张表选对模型)
不是所有模型都适合本地跑。选模型的核心公式:显存/内存 ≥ 模型参数量 × 量化精度 ÷ 字节系数。
以下是2026年7月实测可用的推荐清单:
| 模型 | 参数量 | 推荐量化 | 内存需求 | 适用场景 | 中文能力 |
|---|---|---|---|---|---|
| DeepSeek-R1 | 14B | Q4_K_M | ≥12GB | 推理/数学/编程 | ★★★★★ |
| DeepSeek-R1 | 32B | Q4_K_M | ≥24GB | 深度推理 | ★★★★★ |
| Llama 3.1 | 8B | Q4_K_M | ≥8GB | 通用对话/写作 | ★★★☆☆ |
| Llama 4 Scout | 17B | Q4_K_M | ≥16GB | 多模态理解 | ★★★☆☆ |
| Qwen 2.5 | 14B | Q4_K_M | ≥12GB | 中文创作/翻译 | ★★★★★ |
| Qwen 2.5-Coder | 7B | Q4_K_M | ≥8GB | 代码生成 | ★★★★★ |
| Mistral | 7B | Q4_K_M | ≥8GB | 英文编程 | ★★★★☆ |
| Gemma 2 | 27B | Q4_K_M | ≥20GB | 多语言通用 | ★★★☆☆ |
8GB内存笔记本:选 Llama 3.1 8B 或 Qwen 2.5-Coder 7B,日常办公够用。 16GB MacBook:选 Qwen 2.5 14B 或 DeepSeek-R1 14B,体验媲美云端。 32GB以上:上 DeepSeek-R1 32B,推理能力已经非常接近 GPT-4o。 64GB M4 Max:可以尝试 70B 级别的模型,比如 Llama 3.3 70B 或 DeepSeek-V3。
用以下命令拉取特定量化版本:
# 指定4位量化以节省显存ollama pull deepseek-r1:14b-q4_K_Mollama pull qwen2.5:14b-q4_K_M
第四步:接入 Open WebUI(给它一个ChatGPT界面)
命令行对话是第一步,正经用还得上图形界面。最强的 Ollama 前端是 Open WebUI,一个完全自托管的 ChatGPT 风格界面,支持多模型切换、对话历史、RAG知识库、文件上传。
Docker 安装 Open WebUI:
# 前置条件:已安装 Docker Desktop# macOS/Windows 从 docker.com 下载安装# Linux 用包管理器安装# 拉取并启动 Open WebUIdocker run -d / -p 3000:8080 / --add-host=host.docker.internal:host-gateway / -v open-webui:/app/backend/data / --name open-webui / --restart always / ghcr.io/open-webui/open-webui:main
打开浏览器访问 http://localhost:3000,注册一个本地账号,在设置里选择 Ollama 作为后端,就能看到你下载的所有模型出现在下拉菜单里。界面体验和 ChatGPT 几乎没有差别。
不需要 Docker 的替代方案: Page Assist 浏览器插件直接连接本地 Ollama,Chrome/Edge 扩展商店免费安装,零配置。或者直接用 Enchanted(macOS 原生 App)连本地 Ollama,体验最贴近 ChatGPT 桌面版。

第五步:API调用与进阶配置
Ollama 启动后自动在 localhost:11434 开启了 REST API,完全兼容 OpenAI 的 /v1/chat/completions 格式。这意味着所有用 OpenAI SDK 写的工具,改一行代码就能切到本地模型:
Python 调用示例:
import requestsimport jsonresponse = requests.post( "http://localhost:11434/v1/chat/completions", json={ "model": "deepseek-r1:14b", "messages": [ {"role": "system", "content": "你是一个资深Python开发者"}, {"role": "user", "content": "用Python写一个并发下载文件的脚本"} ], "temperature": 0.7, "max_tokens": 2048 })result = response.json()print(result["choices"][0]["message"]["content"])
环境变量调优(提高推理速度):
# 设置并发请求数(默认1,有GPU可调高)export OLLAMA_NUM_PARALLEL=4# 设置上下文长度(默认2048,长文需求可调大)export OLLAMA_CONTEXT_LENGTH=8192# 使用GPU加速(有NVIDIA显卡)export OLLAMA_GPU_LAYERS=35# 内存限制(防止占用过多系统内存)export OLLAMA_MAX_LOADED_MODELS=2
配置写入 ~/.ollama/config 或通过系统环境变量永久生效。
避坑指南(半年踩出来的血泪)
问题1:模型下载特别慢 默认从 ollama.com 拉取模型文件(通常 4-15GB),国内用户可能遇到速度问题。解决:设置代理环境变量 export HTTPS_PROXY=http://127.0.0.1:7890,或者在 Ollama 设置中配置镜像源。
问题2:回复速度慢、电脑风扇狂转 模型太大,内存不够,系统在疯狂 swap。降低模型参数量,用 q4_K_M 量化版本,或者升级内存。8B 模型在 16GB 电脑上通常能跑出每秒 15-25 token。
问题3:M系列Mac没有用上GPU Ollama 在 Apple Silicon 上默认调用 Metal GPU 加速。用 ollama ps 命令检查模型是否跑在 GPU 上。如果显示 100% CPU,检查 macOS 版本是否 ≥ 13.3。
问题4:多模型切换导致内存不足 同时加载多个大模型会把内存吃光。设置 OLLAMA_MAX_LOADED_MODELS=2 限制常驻内存的模型数量,Ollama 会在切换时自动卸载闲置模型。
这套方案的真正价值在哪?
用 Ollama 跑本地模型的成本是零——没有 API 费用,没有 token 限制,没有"本月用量已用完"的弹窗。
但更重要的是三件事你不需要担心了:
隐私安全:你的对话、文档、代码不会离开你的电脑。处理内部数据、客户信息、商业机密时不需要脱敏。这在一个"所有的AI都想要你的数据"的年代里,是一种稀缺的安全感。
离线使用:飞机上、高铁隧道里、咖啡馆的烂网络下——模型照样跑。一个14B量化模型只有8GB左右,下载一次永久使用。
无限调用:写代码时反复让AI调试不会心疼token;翻译长文档不用说"请继续";深夜跑实验不用盯着API余额。

快速上手指令速查表
# 安装brew install ollama # macOScurl -fsSL https://ollama.com/install.sh | sh # Linux
# 模型管理ollama pull deepseek-r1:14b # 下载模型ollama list # 查看已安装模型ollama rm deepseek-r1:14b # 删除模型ollama cp deepseek-r1:14b my-custom # 复制模型
# 运行对话ollama run deepseek-r1:14b # 进入对话模式ollama run deepseek-r1:14b "用Python写快排" # 单次问答
# 监控调试ollama ps # 查看运行中的模型ollama show deepseek-r1:14b # 查看模型详情
好了,现在打开你的终端,敲下第一行命令:
ollama run deepseek-r1:14b
三个命令之后,你的电脑就变成了一台不需要联网、不花一分钱的 AI 服务器。
安装包获取
| 平台 | 下载地址 | 安装方式 |
|---|---|---|
| macOS | https://ollama.com/download | 下载 .dmg 双击安装 |
| macOS (Homebrew) | — | brew install ollama |
| Windows | https://ollama.com/download/windows | 下载 .exe 双击运行 |
| Linux | https://ollama.com/download/linux | `curl -fsSL https://ollama.com/install.sh |
Open WebUI 安装(为 Ollama 添加 ChatGPT 风格界面):
docker run -d -p 3000:8080 / --add-host=host.docker.internal:host-gateway / -v open-webui:/app/backend/data / --name open-webui --restart always / ghcr.io/open-webui/open-webui:main
安装后访问 http://localhost:3000 即可。
你在本地跑过哪些开源大模型?遇到过什么坑?评论区分享你的Ollama配置和推荐模型,帮更多人少走弯路。
#Ollama #本地大模型 #AI工具拆解 #DeepSeek #Llama #Qwen #AI教程 #
这里给大家精心整理了一份全面的AI大模型学习资源,包括:AI大模型全套学习路线图(从入门到实战)、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等,资料免费分享!
👇👇扫码免费领取全部内容👇👇

1. 成长路线图&学习规划
要学习一门新的技术,作为新手一定要先学习成长路线图,方向不对,努力白费。
这里,我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。

2. 大模型经典PDF书籍
书籍和学习文档资料是学习大模型过程中必不可少的,我们精选了一系列深入探讨大模型技术的书籍和学习文档,它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础。(书籍含电子版PDF)

3. 大模型视频教程
对于很多自学或者没有基础的同学来说,书籍这些纯文字类的学习教材会觉得比较晦涩难以理解,因此,我们提供了丰富的大模型视频教程,以动态、形象的方式展示技术概念,帮助你更快、更轻松地掌握核心知识。

4. 2026行业报告
行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

5. 大模型项目实战
学以致用 ,当你的理论知识积累到一定程度,就需要通过项目实战,在实际操作中检验和巩固你所学到的知识,同时为你找工作和职业发展打下坚实的基础。

6. 大模型面试题
面试不仅是技术的较量,更需要充分的准备。
在你已经掌握了大模型技术之后,就需要开始准备面试,我们将提供精心整理的大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余。

7. 资料领取:全套内容免费抱走,学 AI 不用再找第二份
不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:
👇👇扫码免费领取全部内容👇👇


1899

被折叠的 条评论
为什么被折叠?



