Ollama 本地部署大模型:从安装到实战
如何在本地部署大语言模型?本文教你使用 Ollama 在本地运行 Llama、Qwen、Mistral 等开源模型,含安装、配置、API 调用和常见问题。
这篇教程适合谁
你想在自己电脑上跑开源大模型,不想依赖云端 API。Ollama 是目前最简单的本地模型运行工具——一行命令下载,一行命令运行。
不适合:追求最强模型能力的场景。本地 7B 模型比 GPT-4o 差一截。 最终产物:能在本地跑 Llama、Qwen、Mistral 等模型,并通过 API 集成到自己的应用里。环境假设
- 8GB+ 内存(16GB 推荐)
- 可选:NVIDIA 显卡(6GB+ 显存)
- macOS / Linux / Windows 均可
- 以当前常见版本为准
安装
# macOS / Linux
curl -fsSL https://ollama.ai/install.sh | sh
# Windows:访问 https://ollama.ai 下载安装包
验证:ollama --version
跑第一个模型
ollama run llama3
首次运行自动下载(约 4GB),下载完直接在终端对话。
常用模型
| 模型 | 大小 | 特点 | 适用场景 |
|---|---|---|---|
| llama3 | 4GB | Meta 出品,综合能力强 | 通用对话 |
| qwen2 | 4GB | 阿里出品,中文能力强 | 中文场景 |
| mistral | 4GB | 速度快 | 快速响应 |
| codellama | 4GB | 代码专用 | 编程辅助 |
| phi3 | 2GB | 小巧高效 | 资源受限 |
ollama pull qwen2 # 中文优化
ollama pull codellama # 代码辅助
踩坑点:模型文件很大(4-8GB),第一次下载要等。网络不好的话可能断。ollama pull 支持断点续传,中断了重新跑就行。
API 调用
Ollama 提供兼容 OpenAI 格式的 API:
# 启动服务(macOS/Linux 下 Ollama 安装后自动作为后台服务运行)
ollama serve
curl 调用
curl http://localhost:11434/api/chat -d '{
"model": "llama3",
"messages": [
{"role": "user", "content": "你好,介绍一下自己"}
],
"stream": false
}'
Python 调用
import requests
response = requests.post(
'http://localhost:11434/api/chat',
json={
'model': 'llama3',
'messages': [
{'role': 'user', 'content': '你好,介绍一下自己'}
],
'stream': False
}
)
print(response.json()['message']['content'])
用 OpenAI SDK 调用
from openai import OpenAI
client = OpenAI(
base_url='http://localhost:11434/v1',
api_key='ollama' # 任意值
)
response = client.chat.completions.create(
model='llama3',
messages=[
{'role': 'user', 'content': '你好'}
]
)
print(response.choices[0].message.content)
为什么要用 OpenAI SDK:你的代码只需要改 base_url 就能在本地模型和云端模型之间切换。一套代码,两个后端。
与 Dify 集成
- Ollama 服务运行中
- Dify → 添加模型供应商 → Ollama
- API 地址填
http://localhost:11434 - 选已下载的模型
这样就能用 Dify 的界面 + 本地模型,数据完全不出本机。
常见问题
模型下载慢
检查网络,选小模型先试。ollama pull 支持断点续传。
运行速度慢
- 有 NVIDIA 显卡确保装了 CUDA 驱动
- 换小模型(phi3)
- 减少上下文长度
内存不足
换小模型,关其他程序,或加内存。
下一步学习
- 带 Web 界面的完整方案:本地部署大模型指南
- 了解 AI Agent:AI Agent 是什么
- 对比云端模型:ChatGPT vs Claude
常见问题
相关推荐
获取更多 AI 内容
订阅更新,第一时间获取新教程和工具推荐。