跳转到正文
技术教程·

Ollama 本地部署大模型:从安装到实战

如何在本地部署大语言模型?本文教你使用 Ollama 在本地运行 Llama、Qwen、Mistral 等开源模型,含安装、配置、API 调用和常见问题。

这篇教程适合谁

你想在自己电脑上跑开源大模型,不想依赖云端 API。Ollama 是目前最简单的本地模型运行工具——一行命令下载,一行命令运行。

不适合:追求最强模型能力的场景。本地 7B 模型比 GPT-4o 差一截。 最终产物:能在本地跑 Llama、Qwen、Mistral 等模型,并通过 API 集成到自己的应用里。

环境假设

  • 8GB+ 内存(16GB 推荐)
  • 可选:NVIDIA 显卡(6GB+ 显存)
  • macOS / Linux / Windows 均可
  • 以当前常见版本为准

安装

# macOS / Linux

curl -fsSL https://ollama.ai/install.sh | sh

# Windows:访问 https://ollama.ai 下载安装包

验证:ollama --version

跑第一个模型

ollama run llama3

首次运行自动下载(约 4GB),下载完直接在终端对话。

常用模型

模型大小特点适用场景
llama34GBMeta 出品,综合能力强通用对话
qwen24GB阿里出品,中文能力强中文场景
mistral4GB速度快快速响应
codellama4GB代码专用编程辅助
phi32GB小巧高效资源受限
ollama pull qwen2      # 中文优化

ollama pull codellama # 代码辅助

踩坑点:模型文件很大(4-8GB),第一次下载要等。网络不好的话可能断。ollama pull 支持断点续传,中断了重新跑就行。

API 调用

Ollama 提供兼容 OpenAI 格式的 API:

# 启动服务(macOS/Linux 下 Ollama 安装后自动作为后台服务运行)

ollama serve

curl 调用

curl http://localhost:11434/api/chat -d '{

"model": "llama3",

"messages": [

{"role": "user", "content": "你好,介绍一下自己"}

],

"stream": false

}'

Python 调用

import requests

response = requests.post(

'http://localhost:11434/api/chat',

json={

'model': 'llama3',

'messages': [

{'role': 'user', 'content': '你好,介绍一下自己'}

],

'stream': False

}

)

print(response.json()['message']['content'])

用 OpenAI SDK 调用

from openai import OpenAI

client = OpenAI(

base_url='http://localhost:11434/v1',

api_key='ollama' # 任意值

)

response = client.chat.completions.create(

model='llama3',

messages=[

{'role': 'user', 'content': '你好'}

]

)

print(response.choices[0].message.content)

为什么要用 OpenAI SDK:你的代码只需要改 base_url 就能在本地模型和云端模型之间切换。一套代码,两个后端。

与 Dify 集成

  • Ollama 服务运行中
  • Dify → 添加模型供应商 → Ollama
  • API 地址填 http://localhost:11434
  • 选已下载的模型

这样就能用 Dify 的界面 + 本地模型,数据完全不出本机。

常见问题

模型下载慢

检查网络,选小模型先试。ollama pull 支持断点续传。

运行速度慢

  • 有 NVIDIA 显卡确保装了 CUDA 驱动
  • 换小模型(phi3)
  • 减少上下文长度

内存不足

换小模型,关其他程序,或加内存。

下一步学习

常见问题

相关推荐

获取更多 AI 内容

订阅更新,第一时间获取新教程和工具推荐。