Ollama 本地部署实战:一行命令运行大模型,告别 API 付费

Ollama 本地部署实战:一行命令运行大模型,告别 API 付费

你是否受够了每个月给 ChatGPT 或 Claude 的订阅费?是否担心敏感数据通过 API 上传到云端?Ollama 让你在本地电脑上运行大模型,完全离线、零成本、数据不出本机。

article-7-ollama-clean.md封面

Ollama 是一个用 Go 语言编写的轻量级 LLM 运行框架,目前在 GitHub 上已有超过 169K 星标。它支持 Llama、Mistral、Gemma、DeepSeek 等主流开源模型,提供 macOS、Windows 和 Linux 全平台支持。

### 第一步:安装 Ollama

macOS 和 Windows 用户直接去 ollama.com 下载桌面应用。Linux 用户用一行命令安装:

curl -fsSL https://ollama.com/install.sh | sh

安装完成后,验证是否成功:

ollama --version

### 第二步:下载并运行你的第一个模型

Ollama 的模型管理极其简洁。以最近热门的 DeepSeek-Coder 为例:

ollama pull deepseek-coder:6.7b

参数 `6.7b` 表示 67 亿参数版本。如果你显存充裕(16GB+),可以尝试更大的版本。下载完成后立即开始对话:

ollama run deepseek-coder:6.7b

你现在就拥有了一个完全本地运行的 AI 编程助手,零延迟、零费用。

### 第三步:搭配 Open WebUI,获得 ChatGPT 式体验

命令行虽好用,但图形界面更适合日常使用。Open WebUI(GitHub 132K 星标)为 Ollama 提供了一个类 ChatGPT 的网页界面:

docker run -d -p 3000:8080 \
  -v open-webui:/app/backend/data \
  --name open-webui \
  ghcr.io/open-webui/open-webui:main

打开浏览器访问 `http://localhost:3000`,选择 Ollama 作为后端,就可以像使用 ChatGPT 一样使用你的本地模型了。

### 选择什么模型?

对于日常使用,以下是经过实测的推荐:

| 场景 | 推荐模型 | 显存需求 |

|——|———|———|

| 通用对话 | llama3:8b | 6GB |

| 代码编程 | deepseek-coder:6.7b | 6GB |

| 中文对话 | qwen2:7b | 6GB |

| 轻量设备 | phi3:3.8b | 4GB |

**重要提醒:** 模型越大效果越好,但对显存要求也越高。建议从 7B 级别开始尝试,根据硬件条件逐步升级。

### 进阶技巧:自定义 Modelfile

Ollama 支持通过 Modelfile 自定义模型行为。比如,你想让模型始终以中文回答,或者限定它的回答风格:

# 创建一个 Modelfile
cat > Modelfile << 'EOF'
FROM deepseek-coder:6.7b
SYSTEM "你是一个专业的Python编程助手,始终以简体中文回答问题。代码注释使用中文。"
PARAMETER temperature 0.7
PARAMETER top_p 0.9
EOF

# 基于 Modelfile 创建自定义模型
ollama create my-python-tutor -f Modelfile

# 运行自定义模型
ollama run my-python-tutor

### Ollama vs 云端 API:什么时候该用谁?

| 场景 | 推荐方案 | 原因 |

|——|———|——|

| 处理敏感数据 | Ollama 本地 | 数据不出本机 |

| 快速原型验证 | 云端 API | 模型能力更强 |

| 离线环境开发 | Ollama 本地 | 无需网络 |

| 高并发生产服务 | 云端 API | 扩展性更好 |

| 学习 AI 原理 | Ollama 本地 | 零成本试错 |

**实用建议:** 日常开发和实验用 Ollama 本地跑,生产环境和正式项目用 API。两者互补,而非互斥。

### 常见问题排查

初次使用 Ollama 时,可能会遇到几个常见问题:

下载速度慢:模型文件通常 4-20GB,建议在网络稳定时段下载。如果反复中断,可以先 `ollama pull` 拉取模型,再 `ollama run`。

显存不足:如果运行 7B 模型时出现 CUDA out of memory 错误,尝试 `ollama run model-name:3b` 选择更小的版本。Ollama 也支持纯 CPU 运行(设置环境变量 `OLLAMA_NUM_GPU=0`),虽然慢但能跑。

端口冲突:Open WebUI 默认使用 3000 端口,如果被占用,修改 `docker run` 命令中的 `-p 3000:8080` 为其他端口即可。

Ollama 的杀手锏在于极简体验——没有复杂的配置文件、不需要 CUDA 环境配置、不需要 Python 虚拟环境。对于想入门本地 AI 的开发者来说,这可能是目前门槛最低的方案。

🔥 关注LC智趣厅,每周更新实用的AI工具教程

👇 关注不错过


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

滚动至顶部
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅