欢迎光临
我们一直在努力

在 AMD 锐龙 AI 笔记本上真正用 NPU 玩转 LLM

最近入手了 ThinkBook 锐龙 7 H350 的笔记本,一直想把这颗 NPU 用起来。装了 Ollama,折腾很久才让显卡(Radeon 860M)正常工作,但 NPU 始终没动静。仔细研究 AMD 的相关文档后发现,想充分发挥 NPU 的潜力,需要一套混合分工的软件栈。本文会讲清楚底层原理,并给出可落地的操作步骤。

🧠 核心原理:NPU 与 iGPU 的“动态双打”

在轻薄本上跑大语言模型,最大的瓶颈不是算力,而是显存带宽和功耗。AMD 的设计思路很巧妙:

  • iGPU(Radeon 860M) 并行计算能力强,适合一次性处理你输入的整段 Prompt —— 这叫 Prefill(预填充) 阶段。

  • NPU(XDNA 架构) 擅长低功耗、高吞吐量的持续矩阵运算,适合后续逐字生成答案的 Decode(解码) 阶段。

于是,AMD 的 Hybrid 混合模式 应运而生:Prefill 交给 iGPU,Decode 交给 NPU,两者动态协作,既跑得快又省电。

🗂️ 三种 LLM 推理方案的调用栈全览

为了让你一目了然地看清不同方案如何利用 NPU,下面这张表汇总了三种典型路径:纯 GPU/CPU 方案(作为对比)、Lemonade Server + Ryzen AI 混合模式、以及纯 NPU 的 FastFlowLM 模式。

推理方案调用栈(从上到下:应用 → 硬件)NPU 参与模式典型配置 / 建议
Ollama + llama.cpp (纯 iGPU / CPU 模式) Ollama → llama.cpp → Vulkan / ROCm → AMD Radeon 驱动 → iGPU (Radeon 860M) (未经过 NPU 相关驱动) 未使用 NPU 仅利用集显或 CPU • BIOS 分配 UMA 显存(4GB+) • 运行 ollama run 时无 NPU 加速 • 适合不依赖 NPU 的通用场景
Lemonade Server + Ryzen AI (NPU + iGPU 混合模式) Lemonade Server → Ryzen AI LLM / ONNX Runtime GenAI → Ryzen AI SDK → AMD XDNA 驱动 + Radeon 驱动 → NPU + iGPU 协同 完全利用 • Prefill:iGPU • Decode:NPU • 拉取模型时指定 –recipe ryzenai-llm • 开启 xrt-smi –pmode turbo • 任务管理器可见 NPU 与 GPU 同时跳动
FastFlowLM NPU 模式 (纯 NPU 推理) FastFlowLM → FastFlowLM Runtime → AMD XDNA Runtime → AMD XDNA 驱动 → NPU(XDNA 架构) 纯 NPU 运行 整个推理过程(含 prefill 与 decode)均在 NPU 上完成 • 适合低功耗、连续流式生成 • 模型需转为 ONNX 或特定格式 • 大模型受限于 NPU 容量

从表中可以看出,Lemonade Server + Ryzen AI 混合模式是目前在 ThinkBook 这类轻薄本上最均衡的方案 —— 既能跑较大的模型(利用 iGPU 显存),又能享受 NPU 的低功耗解码。下面我们就按照这个路线实操。

💻 实操步骤:在 ThinkBook 上激活混合算力

1. 准备 BIOS 与驱动
  • 更新 BIOS:去联想官网下载最新 BIOS。新版本对 NPU 调度有优化。

  • 分配显存:进入 BIOS,将 UMA Frame Buffer Size 或 Aperture Size 设为 4GB 或 8GB —— 这是 iGPU 参与 Prefill 的底气。

  • 安装 NPU 驱动:从 AMD 官网下载 AMD NPU Driver 和 Ryzen AI Software(建议 1.7 以上版本)。

2. 开启性能模式

打开管理员权限的“命令提示符”,执行:

cmd

cd C:\\Windows\\System32\\AMD
xrt-smi configure –pmode turbo

可以rt-smi examine –report platform检查状态是否为 Turbo模式。这一步能让 NPU 保持更高频率,显著提升 decode 速度。

3. 安装 Lemonade Server

访问 lemonade-server.ai 或其 GitHub 发布页,下载 Windows 安装程序。安装过程会自动配置好环境依赖。

4. 拉取支持混合模式的模型

你可以通过 Lemonade App 直接下载官方准备好的模型,例如:

  • DeepSeek-R1-Distill-Qwen-7B-Hybrid → 自动启用 NPU + iGPU 混合模式

  • DeepSeek-R1-Distill-Qwen-7B-NPU → 纯 NPU 模式

具体支持模型列表参见:https://lemonade-server.ai/models.html

如果你希望用命令行拉取最新模型,可以尝试:

lemonade-server pull user.Gemma-4-26B-A4B-it-GGUF –recipe llamacpp

最新版本改为

    lemonade pull user.Gemma-4-26B-A4B-it-GGUF –recipe llamacpp

如果你手头有现成的 ONNX 模型,也可以用 ONNX Runtime GenAI 的 C++/Python API 更精细地控制调度策略。

5. 验证是否生效

运行模型后,打开 任务管理器 → 性能:

  • 看到 NPU 和 GPU 的使用率同时跳动 → 混合模式成功。

  • CPU 占用率应该很低,说明计算负载已经卸载到加速器上。

⚠️ 关键注意事项

  • 处理器兼容性:ONNX Runtime GenAI 的混合模式仅在 Ryzen AI 300 系列(STX/KRK)上完整支持。请先确认你的锐龙 7 H350 是否属于该系列,否则可能退化为纯 GPU 模式。

  • 路径避免中文:模型存放路径和 Lemonade 安装路径不要包含中文或空格,以免出现奇怪的加载错误。

  • NPU 利用率低:如果 NPU 一直不工作,可以尝试在 BIOS 中关闭“AMD Platform Security Processor”相关选项(部分机型有冲突)。

🎯 总结

通过 Lemonade Server + Ryzen AI 这套栈,你的 AMD的笔记本就能真正调动 NPU 和 iGPU 进行协同推理 —— 既不像纯 CPU 那样慢吞吞,也不像纯 GPU 那样高功耗。表格中的三种方案可以根据你的模型大小和功耗要求灵活选择。祝你顺利“玩转”本地大模型!

赞(0)
未经允许不得转载:171主机测评 » 在 AMD 锐龙 AI 笔记本上真正用 NPU 玩转 LLM
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址