跳转到正文
技术教程·

本地部署大模型:Ollama + Open WebUI 指南

如何在本地部署大语言模型?本文教你使用 Ollama + Open WebUI 搭建私有 AI 助手,含安装配置、模型选择、API 集成和性能优化。

这篇教程适合你吗

你想在自己电脑上跑大模型——可能是为了数据隐私,可能是不想付 API 费用,也可能是想离线用。本文用 Ollama 跑模型 + Open WebUI 做界面,搭一个私有 ChatGPT。

不适合:追求最强模型能力的场景。本地 7B 模型的能力比 GPT-4o 差一截。如果你需要最强推理能力,云端 API 更合适。 最终产物:一个在 http://localhost:3000 运行的私有 AI 助手,数据不出本机。

环境假设

  • 8GB+ 内存(16GB 推荐)
  • 可选:NVIDIA 显卡(6GB+ 显存,有 CUDA 驱动)
  • Docker(装 Open WebUI 用)
  • macOS / Linux / Windows 均可
  • 以当前常见版本为准

安装 Ollama

# macOS / Linux

curl -fsSL https://ollama.ai/install.sh | sh

# Windows:访问 https://ollama.ai 下载安装包

验证:ollama --version

下载并运行模型

# 中文场景推荐

ollama run qwen2

# 通用场景

ollama run llama3

# 代码辅助

ollama pull codellama

首次运行自动下载模型文件(约 4GB),下载完就能对话。

模型怎么选
  • 内存 16GB+ → 7B 模型(qwen2、llama3)
  • 内存 8GB → 3B 模型(phi3)
  • 需要代码能力 → codellama
  • 中文为主 → qwen2 系列
踩坑点:模型越大越聪明,但也越慢、越吃内存。别一上来就下 70B 的——先用 7B 跑通,确认体验可以接受再升级。

安装 Open WebUI

docker run -d -p 3000:8080 \

--add-host=host.docker.internal:host-gateway \

-v open-webui:/app/backend/data \

--name open-webui \

--restart always \

ghcr.io/open-webui/open-webui:main

访问 http://localhost:3000,首次使用注册管理员账号。

Open WebUI 会自动检测本地 Ollama。如果没连上,在设置里填 http://host.docker.internal:11434

API 集成

Ollama 提供兼容 OpenAI 格式的 API,可以集成到你自己的应用里:

from openai import OpenAI

client = OpenAI(

base_url='http://localhost:11434/v1',

api_key='ollama' # 任意值,Ollama 不校验

)

response = client.chat.completions.create(

model='qwen2',

messages=[

{'role': 'user', 'content': '你好,介绍一下自己'}

]

)

print(response.choices[0].message.content)

为什么要用 OpenAI SDK:因为 Ollama 兼容 OpenAI API 格式,你的代码只需要改 base_url 就能在本地模型和云端模型之间切换。写一套代码,两个后端都能用。

与 Dify 集成

Ollama 可以作为 Dify 的模型后端:

  • Ollama 服务运行中
  • Dify → 添加模型供应商 → Ollama
  • API 地址填 http://localhost:11434
  • 选已下载的模型

这样你就能用 Dify 的低代码界面 + 本地模型,数据完全不出本机。

性能优化

  • GPU 加速:有 NVIDIA 显卡确保装了 CUDA 驱动,Ollama 自动用 GPU
  • 减少上下文长度:上下文越短,内存占用越低,响应越快
  • SSD:模型文件加载从 SSD 读,比 HDD 快很多

本地部署的取舍

优势
  • 数据不出本机,隐私最好
  • 无 API 费用
  • 可离线使用
劣势
  • 模型能力比云端弱(7B vs GPT-4o 差距明显)
  • 需要硬件配置
  • 推理速度取决于你的机器
建议:如果只是日常对话、代码辅助、文档总结,本地 7B 模型够用。如果需要复杂推理、多模态能力,还是用云端 API。

下一步学习

---

本文最后更新于 2026-07-08。Ollama 和 Open WebUI 版本更新较快,请以官方文档为准。

常见问题

相关推荐

获取更多 AI 内容

订阅更新,第一时间获取新教程和工具推荐。