欢迎光临
我们一直在努力

Qwen3.8 Flash-Next 开放权重:FP8 也要 172.78 GiB,算家云 5090 到底怎么部署?

更新日期:2026 年 8 月 27 日 适用对象:大模型部署、vLLM、云 GPU、Agent 应用开发者

2026 年 8 月 27 日,Qwen 新增开放权重的是 Qwen3.8-Flash-Next 和官方 FP8 量化版。先说结论:这是同一个模型的两种权重格式,FP8 权重仍有 172.78 GiB,不能把“每个 Token 激活 6B 参数”理解成“一张消费级显卡就能跑”。

今天到底开放了哪些 Qwen3.8?

截至 2026 年 8 月 27 日,Qwen 官方模型页可以确认:

模型本次新增权重规模许可证适合场景
Qwen/Qwen3.8-Flash-Next BF16 约 335.28 GiB Qwen Community 1.0 高端多卡、架构研究
Qwen/Qwen3.8-Flash-Next-FP8 172.78 GiB Qwen Community 1.0 多卡推理、服务部署
Qwen/Qwen3.8-27B 否,8 月 14 日已发布 27B Dense 以模型页为准 单卡或双卡部署
Qwen/Qwen3.8-2.4T-A95B 否,8 月 12 日已发布 2.4T、激活 95B 以模型页为准 超大规模推理集群

严格来说,本文使用“开放权重”比笼统称为“开源”更准确。Flash-Next 模型权重页显示的许可证为 qwen-community-1.0,不要与 Qwen GitHub 仓库的 Apache-2.0 许可证混为一谈。

官方来源:Qwen3.8-Flash-Next 模型页、FP8 模型页、Qwen3.8 官方仓库。

为什么激活参数只有 6B,显存要求仍然很高?

Flash-Next 的结构包含:

  • 125B 主模型参数,每个 Token 激活约 6B;
  • 额外的 51B N-gram Embedding;
  • 约 4B MTP 参数;
  • 262,144 Token 原生上下文,可通过 YaRN 扩展至 100 万 Token;
  • 视觉编码器,支持文本和图像输入。

MoE 的“激活参数少”主要降低单次计算量,并不会让未激活权重凭空消失。模型加载时仍要考虑全部权重、KV Cache、CUDA Kernel、运行时缓存和并发空间。

根据 vLLM 官方部署配方:

版本权重大小官方验证配置
FP8 172.78 GiB GB300 最低 TP2,推荐 TP4;H200 使用 TEP8
BF16 335.28 GiB 验证配置约占每张 GB300 190 GiB
N-gram CPU Offload 额外要求 至少准备 51 GB 主机内存及运行余量

所以,RTX 4090、RTX 5090、A100 80G 都不是 Flash-Next 官方首发配方中的单卡部署设备。尤其不要看到“激活 6B”就直接按 6B 模型估算显存。

路线一:按官方配置部署 Flash-Next FP8

目前比较稳妥的是使用 vLLM 提供的专用镜像,而不是直接执行普通的 pip install vllm:

docker pull vllm/vllm-openai:qwen38-flash-next

以官方验证的 8×H200 配置为例:

vllm serve Qwen/Qwen3.8-Flash-Next-FP8 \\
–tensor-parallel-size 8 \\
–enable-expert-parallel \\
–moe-backend triton \\
–gpu-memory-utilization 0.85 \\
–max-num-seqs 256 \\
–enable-prefix-caching \\
–no-enable-flashinfer-autotune \\
–enable-auto-tool-choice \\
–tool-call-parser qwen3_xml \\
–reasoning-parser qwen3

这里有一个容易踩坑的点:官方配方明确指出,H200 上不能直接使用普通 TP8 加载该 FP8 权重,需要启用专家并行,即 TEP8。

如果加载阶段 OOM,可以依次检查:

  • 是否使用了 Flash-Next 专用 vLLM 镜像;
  • 是否误把原生上下文直接扩到 100 万 Token;
  • 是否需要启用 N-gram Embedding CPU Offload;
  • 是否给主机内存预留了至少 51 GB 加运行余量;
  • 是否需要提高 TP 数量或降低 –max-model-len。
  • 路线二:想在算家云(suanjiayun.com) 尽快跑起来,先部署 Qwen3.8-27B

    如果目标是今天完成 Qwen3.8 API 验证,而不是研究 Flash-Next 架构,更现实的选择是 Qwen3.8-27B。

    vLLM 官方配方已经验证:

    • 2×RTX 5090 可以运行 Qwen3.8-27B 的 FP8 或 NVFP4 版本;
    • 1×RTX 5090 可以运行 NVFP4,但需要降低上下文并增加 –enforce-eager;
    • 双卡配置更适合保留长上下文和 KV Cache 空间。

    算家云当前官网列出了 32GB 显存的 RTX 5090。实际库存、区域和可选卡数会动态变化,应以创建实例页面为准。

    在算家云创建实例后,先检查运行环境:

    nvidia-smi
    python -V
    python -c "import torch; print(torch.__version__, torch.cuda.is_available())"

    如果创建页面提供双 RTX 5090,可以参考以下 FP8 启动方式:

    vllm serve Qwen/Qwen3.8-27B-FP8 \\
    –tensor-parallel-size 2 \\
    –max-model-len 262144 \\
    –kv-cache-dtype fp8 \\
    –reasoning-parser qwen3 \\
    –enable-auto-tool-choice \\
    –tool-call-parser qwen3_coder

    启动后验证 OpenAI 兼容接口:

    curl http://127.0.0.1:8000/v1/chat/completions \\
    -H "Content-Type: application/json" \\
    -d '{
    "model": "Qwen/Qwen3.8-27B-FP8",
    "messages": [
    {"role": "user", "content": "用 Python 实现一个带重试的异步 HTTP 客户端"}
    ],
    "temperature": 1.0,
    "top_p": 0.95,
    "max_tokens": 1024
    }'

    如果服务只返回 <think> 内容,或者答案被推理过程挤占,需要确认启动参数中包含:

    –reasoning-parser qwen3

    算家云适合放在哪个环节?

    算家云更适合承担“按需准备 GPU 环境、下载权重、启动推理服务、完成 API 验收”这段工程流程。

    平台支持 SSH、JupyterLab、VS Code 等连接方式;按量实例开机开始计算算力费用,关机结束实例算力计费,不足一小时的使用时段按秒计费。模型权重、数据盘等关联资源是否继续计费,则要分别查看对应规则。

    对于 Qwen3.8,建议这样选:

    目标建议路线
    快速验证 Qwen3.8 对话、代码和工具调用 双 RTX 5090 + Qwen3.8-27B-FP8
    单卡实验 RTX 5090 + 27B NVFP4,缩短上下文
    研究 Flash-Next 新架构 选择官方验证的 H200、B200、GB300 等多卡配置
    生产级高并发 先压测吞吐、首 Token 延迟和 KV Cache,再决定 TP/TEP
    只是调用模型能力 直接使用托管 API,避免维护推理基础设施

    FAQ

    Qwen3.8-Flash-Next 是 6B 模型吗?

    不是。它的主模型为 125B 参数,每个 Token 激活约 6B,此外还有 51B N-gram Embedding 和 MTP 参数。

    一张 RTX 5090 能运行 Flash-Next FP8 吗?

    不能按官方 FP8 权重直接加载。FP8 checkpoint 为 172.78 GiB,远超单张 RTX 5090 的 32GB 显存。

    为什么推荐在算家云先跑 Qwen3.8-27B?

    因为 27B 已有双 RTX 5090 的 vLLM 验证记录,工程门槛明显低于 Flash-Next,更适合快速完成 API 和业务效果验证。

    Flash-Next 能直接使用 100 万 Token 上下文吗?

    原生上下文是 262,144 Token。扩展至 100 万 Token 需要显式启用 YaRN,并重新评估显存占用和短上下文质量。

    这篇命令是实测结果吗?

    不是。模型规格和启动参数来自 Qwen、vLLM 官方资料;算家云 RTX 5090 规格来自平台页面。正式部署前仍需按实时库存和当前推理框架版本验证。

    赞(0)
    未经允许不得转载:171主机测评 » Qwen3.8 Flash-Next 开放权重:FP8 也要 172.78 GiB,算家云 5090 到底怎么部署?
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址