欢迎光临
我们一直在努力

Ollama-使用速查

Ollama 使用速查(Windows / RTX 5060 Ti 16GB)

本机环境:Ollama 0.14.2 · RTX 5060 Ti 16GB · 32GB 内存
关键认知:「关模型」和「关服务」是两件事。服务常驻只占几十 MB 内存,显存只在加载模型时才被占用。


一、拉取模型(pull)

ollama pull qwen3-vl:8b # 拉取指定模型
ollama pull qwen3.5:9b # 同档备选
ollama pull gemma4:e4b # 支持音频输入的多模态

拉取过程可中断,重新执行 ollama pull 会断点续传。


二、查看与管理本地模型

命令作用
ollama list 列出已下载的全部模型及体积
ollama show qwen3-vl:8b 查看某模型的参数、模板、量化信息
ollama rm qwen3-vl:8b 删除模型,释放磁盘
ollama ps 查看当前正在运行(加载在显存)的模型

ollama ps 的输出列含义:

列含义
SIZE 占用的显存/内存总量
PROCESSOR 100% GPU = 全在显存;出现 CPU/GPU = 溢出到内存,速度暴跌
UNTIL 还有多久自动卸载(倒计时,默认 5 分钟后)

三、启动模型(三种方式)

1)交互式对话(最常用)

ollama run qwen3-vl:8b

进入对话界面后直接输入问题;输入 /bye 或按 Ctrl+D 退出。

2)单次提问(问完就走,适合脚本)

ollama run qwen3-vl:8b "用一句话解释什么是量化"

3)只启动服务,用 API 调用(适合接客户端/程序)

ollama serve # Windows 托盘程序通常已在后台跑着,无需手动执行
curl http://localhost:11434/api/chat -d "{\\"model\\":\\"qwen3-vl:8b\\",\\"messages\\":[{\\"role\\":\\"user\\",\\"content\\":\\"你好\\"}]}"

常用启动参数(ollama run 支持):

ollama run qwen3-vl:8b –verbose # 输出真实的 tok/s 速度数据
ollama run qwen3-vl:8b –keepalive 0 # 问完立刻卸载,不占显存
ollama run qwen3-vl:8b –keepalive 2h # 保持加载 2 小时


四、关闭 / 卸载模型

场景做法
立即卸载显存(推荐) ollama stop qwen3-vl:8b
用完自动卸载,不手动敲命令 ollama run qwen3-vl:8b –keepalive 0
什么都不做 默认 5 分钟无请求后自动卸载,无需干预
查看卸载倒计时 ollama ps,看 UNTIL 列
退出对话界面 /bye 或 Ctrl+D(注意:退出对话不会卸载模型)

时长写法:0(立即)· 30s · 5m · 2h · -1(永不卸载)


五、关闭 Ollama 服务本身(不想它 24 小时开着)

  • 退出托盘程序:任务栏右下角找到 Ollama 图标 → 右键 → Quit Ollama。
    服务随之停止,端口 11434 关闭。
  • 临时停止进程(图形界面不好找时):taskkill /IM "ollama app.exe" /F
    taskkill /IM ollama.exe /F

  • 取消开机自启:设置 → 应用 → 启动 → 把 Ollama 关掉;
    或任务管理器 → 启动应用 → Ollama → 禁用。
    (本机注册表启动项中未发现 Ollama 条目,可能装在了其他位置或以服务方式注册,可用任务管理器启动项页确认。)
  • 手动再启动:开始菜单搜索 Ollama 双击即可,或命令行 ollama serve。

  • 六、设置模型存储位置

    [!IMPORTANT] 实测踩坑(2026-09-21 本机验证)
    Ollama 0.34 桌面版:只改 OLLAMA_MODELS 环境变量是无效的!
    桌面应用把自己的设置存在
    C:\\Users\\<你>\\AppData\\Local\\Ollama\\db.sqlite → 表 settings → 字段 models,
    应用内设置优先于环境变量。只改环境变量时,服务器日志里依然显示旧路径。

    判断当前实际生效路径的方法——查看服务器启动日志:
    C:\\Users\\<你>\\AppData\\Local\\Ollama\\server.log
    搜索 msg="server config",该行里的 OLLAMA_MODELS: 就是真正的生效值。

    ✅ 正确改法(推荐,0.34.2 实测确认有此项)

    打开 Ollama 桌面应用 → 设置(Settings) → 找到 「Model location」(副标题:Location where models are stored.)→
    该输入框是只读的,不能手打,点右侧 「Browse」 按钮 → 在系统目录选择器里选目标文件夹 → 自动生效。

    实测:Browse 按钮调用的是应用内 selectModelsDirectory() 原生目录选择器,选完直接写回设置项 Models。
    改完建议重启一次 Ollama,再按上面的方法看 server.log 确认生效。

    备选:直接改数据库(需先完全退出应用)

  • 托盘右键 → Quit Ollama(确保进程全部退出)
  • 用 SQLite 工具把 settings.models 改成目标路径:UPDATE settings SET models = 'D:\\ollama\\models' WHERE id = 1;
  • 重新启动 Ollama
  • 环境变量(仅对命令行 / 无桌面应用场景有意义)

    [Environment]::SetEnvironmentVariable("OLLAMA_MODELS", "D:\\ollama\\models", "User")

    设完必须完全重启 Ollama。注意在桌面版上它可能被 db.sqlite 里的设置覆盖。

    迁移已有模型(下完再搬也可以,但要守三条)

    模型本体就是 models 目录下的普通文件,迁移是官方支持的常规操作,但下面三条缺一不可:

  • 必须先完全退出 Ollama(托盘 → Quit Ollama)。服务进程会锁住分片文件,运行中搬会失败或搬出损坏文件。
  • 整个 models 目录一起搬,blobs + manifests 两层必须完整。只搬 blobs → ollama list 会全部变空(磁盘还占着,模型"消失"了)。
  • 搬完必须同步把上面的 Model location 改成新路径。只搬文件夹不改设置,Ollama 会继续往旧目录下载。
  • # 同盘移动是瞬时的;跨盘移动等于复制,6GB 级模型约 1~2 分钟
    move C:\\Users\\35006\\.ollama\\models D:\\ollama\\models

    搬完验证:

    ollama list # 模型列表应和搬之前完全一致
    ollama ps # 空表 = 没有模型占用显存

    ⚠️ 下载到一半不要搬:分片文件(*-partial*)只在原目录内可续传,换目录后 Ollama 会丢弃重下。
    要么等下载完再搬,要么先改路径再重下(后者更省事)。

    其他相关环境变量

    变量建议值作用
    OLLAMA_KEEP_ALIVE 5m(默认)或 0 全局默认卸载时间;-1 常驻显存
    OLLAMA_MAX_LOADED_MODELS 1 同时只加载一个模型,16GB 显存建议设 1
    OLLAMA_MODELS 见上文警告 模型存储位置(桌面版可能被应用设置覆盖)
    OLLAMA_HOST 127.0.0.1:11434 服务监听地址

    七、本机推荐动作清单

    ollama pull qwen3-vl:8b # 先拉基准模型
    ollama run qwen3-vl:8b –verbose # 跑一次,看真实 tok/s
    ollama ps # 确认 PROCESSOR 是 100% GPU
    ollama stop qwen3-vl:8b # 不用时手动卸载

    注意:你的卡是 16GB,一旦 ollama ps 里出现 CPU/GPU 混合,说明模型溢出到系统内存,速度会从 50 tok/s 掉到个位数,直接 ollama stop 换更小的模型即可。

    赞(0)
    未经允许不得转载:171主机测评 » Ollama-使用速查
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址