Ollama本地部署大模型完全教程:从安装到API调用

什么是Ollama

Ollama是2026年最流行的本地大模型运行工具,支持一键下载和运行Llama 3、Qwen 2、DeepSeek等开源模型。完全免费、数据不出本地,是搭建私有AI服务的首选方案。

一、硬件配置要求

不同模型大小对硬件要求不同,参考下表:

没有独立显卡也能用,纯CPU运行7B模型约10-15 tokens/s,日常使用足够。

二、安装Ollama(全平台)

Windows安装

访问 ollama.com 下载Windows安装包。建议自定义安装路径避免C盘爆满:

# 在安装包目录打开CMD
OllamaSetup.exe /DIR=D:\Ollama

安装后设置模型存储路径:系统环境变量 → 新建 OLLAMA_MODELS = D:\ollama_models

macOS安装

brew install ollama

Linux安装

curl -fsSL https://ollama.com/install.sh | sh

Docker部署

docker run -d --name ollama -p 11434:11434 -v ollama_data:/root/.ollama ollama/ollama

三、下载和运行模型

# 下载Llama 3.1 8B
ollama pull llama3.1:8b

# 下载Qwen 2.5 7B(中文优秀)
ollama pull qwen2.5:7b

# 下载DeepSeek V3
ollama pull deepseek-v3

# 运行模型对话
ollama run qwen2.5:7b

# 查看已安装模型
ollama list

四、配置API接口

Ollama内置REST API,默认监听 localhost:11434。可以在任何支持OpenAI API的应用中替换使用:

import requests

response = requests.post('http://localhost:11434/api/chat', json={
    "model": "qwen2.5:7b",
    "messages": [{"role": "user", "content": "你好"}],
    "stream": False
})
print(response.json()['message']['content'])

五、集成到VS Code

安装VS Code的Continue插件,配置使用本地Ollama:

# config.json
{
  "models": [{
    "title": "Local Qwen",
    "provider": "ollama",
    "model": "qwen2.5:7b"
  }]
}

配置完成后,在VS Code中按Ctrl+L即可调用本地模型进行代码补全和问答。也可参考我们的 DeepSeek本地部署教程 了解更多模型接入方式。

六、常见问题

Q: 模型下载太慢? A: 使用国内镜像 ollama pull qwen2.5:7b --insecure 或配置代理。

Q: 内存不够? A: 选择更小的量化版本,如 qwen2.5:3b

Q: 如何卸载模型? A: ollama rm qwen2.5:7b

📚 常见问题

Ollama本地部署大模型完全是什么?

Ollama是2026年最流行的本地大模型运行工具,支持一键下载和运行Llama 3、Qwen 2、DeepSeek等开源模型。完全免费、数据不出本地,是搭建私有AI服务的首选方案。

如何上手Ollama本地部署大模型完全?

Ollama本地部署大模型教程