什么是Ollama
Ollama是2026年最流行的本地大模型运行工具,支持一键下载和运行Llama 3、Qwen 2、DeepSeek等开源模型。完全免费、数据不出本地,是搭建私有AI服务的首选方案。
一、硬件配置要求
不同模型大小对硬件要求不同,参考下表:
- 入门级(3B模型):4GB显存/8GB内存,老旧笔记本可跑
- 主流级(7B-14B模型):6-8GB显存,RTX 3060/4060,Mac M系列
- 高性能(14B-32B模型):12-16GB显存,RTX 4080/4090
- 发烧级(70B模型):24GB+显存,RTX 4090 24G或A100
没有独立显卡也能用,纯CPU运行7B模型约10-15 tokens/s,日常使用足够。
二、安装Ollama(全平台)
Windows安装
访问 ollama.com 下载Windows安装包。建议自定义安装路径避免C盘爆满:
# 在安装包目录打开CMD
OllamaSetup.exe /DIR=D:\Ollama
安装后设置模型存储路径:系统环境变量 → 新建 OLLAMA_MODELS = D:\ollama_models
macOS安装
brew install ollama
Linux安装
curl -fsSL https://ollama.com/install.sh | sh
Docker部署
docker run -d --name ollama -p 11434:11434 -v ollama_data:/root/.ollama ollama/ollama
三、下载和运行模型
# 下载Llama 3.1 8B
ollama pull llama3.1:8b
# 下载Qwen 2.5 7B(中文优秀)
ollama pull qwen2.5:7b
# 下载DeepSeek V3
ollama pull deepseek-v3
# 运行模型对话
ollama run qwen2.5:7b
# 查看已安装模型
ollama list
四、配置API接口
Ollama内置REST API,默认监听 localhost:11434。可以在任何支持OpenAI API的应用中替换使用:
import requests
response = requests.post('http://localhost:11434/api/chat', json={
"model": "qwen2.5:7b",
"messages": [{"role": "user", "content": "你好"}],
"stream": False
})
print(response.json()['message']['content'])
五、集成到VS Code
安装VS Code的Continue插件,配置使用本地Ollama:
# config.json
{
"models": [{
"title": "Local Qwen",
"provider": "ollama",
"model": "qwen2.5:7b"
}]
}
配置完成后,在VS Code中按Ctrl+L即可调用本地模型进行代码补全和问答。也可参考我们的 DeepSeek本地部署教程 了解更多模型接入方式。
六、常见问题
Q: 模型下载太慢? A: 使用国内镜像 ollama pull qwen2.5:7b --insecure 或配置代理。
Q: 内存不够? A: 选择更小的量化版本,如 qwen2.5:3b。
Q: 如何卸载模型? A: ollama rm qwen2.5:7b