一、Ollama 到底是什么?
Ollama 是一款开源的大模型运行与管理工具,核心目标是「简化本地大模型部署流程」,让非专业开发者也能轻松在个人电脑、服务器上运行各类主流大语言模型。
相比传统的大模型部署方式(需要配置环境、安装依赖、调试参数),Ollama 有3个核心优势,也是它火起来的关键:
-
简单高效:无需复杂配置,一行命令完成安装、模型下载与启动,全程无门槛;
-
跨平台兼容:完美支持 macOS、Linux、Windows 三大系统,不管你用什么电脑都能装;
-
模型丰富:内置上百款主流模型,涵盖 Llama 3、Qwen2.5、DeepSeek、Mistral 等,支持按需下载,轻量模型(1B)、中大型模型(7B/8B)都能适配;
-
支持扩展:自带 OpenAI 格式 API,现有项目可直接迁移,还能自定义模型、配置参数,满足开发者进阶需求。
适用人群:大模型新手、开发者、需要本地运行模型(注重数据隐私)的办公人员,无需专业的AI知识,跟着步骤走就能上手。
二、如何安装?
访问 Ollama 官方下载地址:https://ollama.com/download,点击「Download for Windows」下载 OllamaSetup.exe 安装包;
双击安装包,按照提示下一步,务必勾选「Add to PATH」(添加环境变量,否则终端无法识别 ollama 命令);
安装完成后,打开 PowerShell 或 CMD,输入ollama –version,显示版本号即安装成功。

三、核心操作:Ollama 基础命令实战
Ollama 主要通过命令行操作,核心命令就10个左右,记住常用的几个,就能满足90%的使用需求。所有命令均在终端(macOS/Linux)或 PowerShell/CMD(Windows)中执行,复制即可使用。
3.1 启动 Ollama 服务(关键第一步)
安装完成后,必须先启动 Ollama 服务,才能下载模型、进行对话,两种启动方式可选:
# 方法一:前台启动(推荐新手,直观看到服务状态)
ollama serve
# 注意:此命令会占用当前终端窗口,需保持打开,再新开一个终端执行其他命令
# 方法二:后台启动(macOS/Linux 进阶用户)
ollama serve &
# 后台启动后,可直接在当前终端执行其他命令
Windows 用户注意:安装后 Ollama 会自动在后台运行(可在系统托盘查看 Ollama 图标),若未启动,执行 ollama serve 即可。
验证服务:输入以下命令,能正常返回信息即服务启动成功
curl http://localhost:11434/api/tags

3.2 模型管理:下载、查看、删除(最常用)
Ollama 支持上百款模型,可在 Ollama 官方模型库 查看所有模型,推荐新手先从轻量模型入手,下载速度快、占用资源少。
# 1. 下载模型(推荐3个常用模型,按需选择)
# 中文优先:通义千问 7B(适合中文对话、办公提效)
ollama pull qwen2.5:7b
# 轻量入门:DeepSeek-R1 1.5B(仅1.1GB,适合配置较低的电脑)
ollama pull deepseek-r1:1.5b
# 通用首选:Llama 3.1 8B(英文、中文都支持,性能均衡)
ollama pull llama3.1:8b
# 2. 查看本地已安装的模型
ollama list
# 输出示例:
# NAME ID SIZE MODIFIED
# qwen2.5:7b 846a0b7e 4.7GB 2 hours ago
# llama3.1:8b a7872503 4.9GB 1 day ago
# 3. 删除不需要的模型(释放磁盘空间)
ollama rm 模型名称
# 示例:删除 deepseek-r1:1.5b 模型
ollama rm deepseek-r1:1.5b

3.3 模型运行:与模型交互对话
模型下载完成后,通过以下命令启动模型,进入交互模式,即可和模型对话、提问、生成内容。
# 启动指定模型(以 qwen2.5:7b 为例)
ollama run qwen2.5:7b
# 启动后会出现 >>> 提示符,输入问题即可交互
>>> 帮我写一段Python读取Excel的代码
# 模型会自动生成响应,等待即可
# 退出交互模式(两种方法)
# 方法一:输入 /exit
>>> /exit
# 方法二:按 Ctrl+D(macOS/Linux)或 Ctrl+Z(Windows)
小技巧:交互模式中,可输入 /help 查看所有可用指令,比如切换模型、清空对话历史等。
3.4 其他常用命令(补充)
# 查看模型详细信息(如参数、系统提示)
ollama show 模型名称
# 示例:查看 qwen2.5:7b 模型信息
ollama show qwen2.5:7b
# 复制模型(创建模型副本,用于测试配置)
ollama cp 源模型名称 目标模型名称
# 示例:复制 qwen2.5:7b 为 qwen2.5:7b-copy
ollama cp qwen2.5:7b qwen2.5:7b-copy
# 查看当前运行的模型实例
ollama ps
四、进阶用法:国内加速+API调用+自定义模型
掌握基础操作后,分享3个实用进阶技巧,让 Ollama 更好用,满足开发者的个性化需求。
4.1 国内加速配置(必做,解决下载慢问题)
Ollama 官方模型库在国内访问较慢,配置国内镜像可大幅提升下载速度,两种配置方式(临时生效、永久生效):
# 1. 临时生效(仅当前终端有效,重启终端失效)
# macOS / Linux
export OLLAMA_MODEL_SERVER=https://mirror.ollama.com
# Windows(PowerShell)
$env:OLLAMA_MODEL_SERVER="https://mirror.ollama.com"
# 2. 永久生效(推荐,一劳永逸)
# macOS / Linux
# 编辑配置文件(bashrc 或 zshrc,根据自己的终端选择)
nano ~/.bashrc # 或 ~/.zshrc
# 在文件末尾添加以下内容
export OLLAMA_MODEL_SERVER=https://mirror.ollama.com
# 保存后重新加载配置
source ~/.bashrc # 或 source ~/.zshrc
# Windows
右键「此电脑」→「属性」→「高级系统设置」→「环境变量」
在「用户变量」中新建:
变量名:OLLAMA_MODEL_SERVER
变量值:https://mirror.ollama.com
# 保存后重启终端,配置生效
4.2 API 调用:集成到自己的项目中
Ollama 自带 OpenAI 格式 API,默认端口为 11434,可通过 API 调用模型,集成到 Python、Java 等项目中,实现自动化交互。
示例1:Python 调用 API 实现对话(需安装 requests 库)
# 安装 requests 库(若未安装)
# pip install requests
import requests
def ollama_chat(model, prompt):
url = "http://localhost:11434/api/chat"
payload = {
"model": model,
"messages": [{"role": "user", "content": prompt}]
}
response = requests.post(url, json=payload)
# 解析响应(流式输出,模拟实时对话)
for line in response.iter_lines():
if line:
data = line.decode("utf-8")
print(data, end="")
# 调用示例(使用 qwen2.5:7b 模型)
ollama_chat("qwen2.5:7b", "帮我解释一下什么是Ollama")
示例2:API 生成文本(非对话模式)
curl http://localhost:11434/api/generate -d '{
"model": "qwen2.5:7b",
"prompt": "写一篇关于Ollama的简短介绍,适合发布在CSDN",
"options": {"num_ctx": 1024}
}'
常用 API 端点说明:
-
/api/chat:对话交互(支持多轮对话);
-
/api/generate:单条提示生成文本;
-
/api/tags:查看本地模型(对应 ollama list);
-
/api/delete:删除模型(对应 ollama rm)。
4.3 自定义模型:通过 Modelfile 定制模型行为
Ollama 支持通过 Modelfile 配置模型的系统提示、参数,创建自定义模型,适合特定场景(如代码助手、翻译助手)。
# 1. 创建 Modelfile 文件(新建文本文件,命名为 Modelfile,无后缀)
# 内容示例(基于 qwen2.5:7b 定制代码助手)
FROM qwen2.5:7b
SYSTEM 你是一个专业的Python代码助手,只输出代码和简洁注释,不多余废话。
PARAMETER temperature 0.3 # 降低创造力,让输出更精准
PARAMETER num_ctx 2048 # 增加上下文长度,支持更长的代码输入
# 2. 基于 Modelfile 创建自定义模型
ollama create python-assistant -f Modelfile
# 3. 运行自定义模型
ollama run python-assistant
# 此时模型会按照 Modelfile 中的配置响应,专注于Python代码
五、常见问题排查
使用过程中可能会遇到一些小问题,整理了5个高频问题,附上解决方案,帮你快速解决。
问题1:终端提示「Error: ollama server not responding」(服务未响应) 解决方案:① 确认已启动服务(执行 ollama serve);② 检查端口 11434 是否被占用(macOS/Linux:lsof -i :11434;Windows:netstat -ano | findstr :11434),占用则关闭对应进程;③ 重启终端,重新启动服务。
问题2:模型下载缓慢、卡顿 解决方案:配置国内镜像(见4.1),或更换稳定的网络,避免中途中断;若模型较大,可选择量化版本(如 qwen2.5:7b-chat-q4_0,占用空间更小,下载更快)。
问题3:启动模型后,电脑卡顿、内存占用过高 解决方案:① 选择轻量模型(如 1B、7B 量化版),避免运行 13B 及以上模型;② 关闭其他占用内存的程序;③ 若有 GPU,Ollama 会自动调用 GPU 加速,无需额外配置。
问题4:Windows 系统提示「command not found: ollama」 解决方案:① 重启终端;② 检查安装时是否勾选「Add to PATH」,未勾选则手动配置环境变量;③ 重新安装 Ollama,确保勾选环境变量选项。
问题5:交互模式中,模型响应乱码 解决方案:终端编码问题,Windows 可在 PowerShell 中执行 chcp 65001(设置 UTF-8 编码),macOS/Linux 无需额外配置。





