更新日期:2026 年 8 月 27 日 适用对象:大模型部署、vLLM、云 GPU、Agent 应用开发者
2026 年 8 月 27 日,Qwen 新增开放权重的是 Qwen3.8-Flash-Next 和官方 FP8 量化版。先说结论:这是同一个模型的两种权重格式,FP8 权重仍有 172.78 GiB,不能把“每个 Token 激活 6B 参数”理解成“一张消费级显卡就能跑”。
今天到底开放了哪些 Qwen3.8?
截至 2026 年 8 月 27 日,Qwen 官方模型页可以确认:
| Qwen/Qwen3.8-Flash-Next | 是 | BF16 约 335.28 GiB | Qwen Community 1.0 | 高端多卡、架构研究 |
| Qwen/Qwen3.8-Flash-Next-FP8 | 是 | 172.78 GiB | Qwen Community 1.0 | 多卡推理、服务部署 |
| Qwen/Qwen3.8-27B | 否,8 月 14 日已发布 | 27B Dense | 以模型页为准 | 单卡或双卡部署 |
| Qwen/Qwen3.8-2.4T-A95B | 否,8 月 12 日已发布 | 2.4T、激活 95B | 以模型页为准 | 超大规模推理集群 |
严格来说,本文使用“开放权重”比笼统称为“开源”更准确。Flash-Next 模型权重页显示的许可证为 qwen-community-1.0,不要与 Qwen GitHub 仓库的 Apache-2.0 许可证混为一谈。
官方来源:Qwen3.8-Flash-Next 模型页、FP8 模型页、Qwen3.8 官方仓库。
为什么激活参数只有 6B,显存要求仍然很高?
Flash-Next 的结构包含:
- 125B 主模型参数,每个 Token 激活约 6B;
- 额外的 51B N-gram Embedding;
- 约 4B MTP 参数;
- 262,144 Token 原生上下文,可通过 YaRN 扩展至 100 万 Token;
- 视觉编码器,支持文本和图像输入。
MoE 的“激活参数少”主要降低单次计算量,并不会让未激活权重凭空消失。模型加载时仍要考虑全部权重、KV Cache、CUDA Kernel、运行时缓存和并发空间。
根据 vLLM 官方部署配方:
| FP8 | 172.78 GiB | GB300 最低 TP2,推荐 TP4;H200 使用 TEP8 |
| BF16 | 335.28 GiB | 验证配置约占每张 GB300 190 GiB |
| N-gram CPU Offload | 额外要求 | 至少准备 51 GB 主机内存及运行余量 |
所以,RTX 4090、RTX 5090、A100 80G 都不是 Flash-Next 官方首发配方中的单卡部署设备。尤其不要看到“激活 6B”就直接按 6B 模型估算显存。
路线一:按官方配置部署 Flash-Next FP8
目前比较稳妥的是使用 vLLM 提供的专用镜像,而不是直接执行普通的 pip install vllm:
docker pull vllm/vllm-openai:qwen38-flash-next
以官方验证的 8×H200 配置为例:
vllm serve Qwen/Qwen3.8-Flash-Next-FP8 \\
–tensor-parallel-size 8 \\
–enable-expert-parallel \\
–moe-backend triton \\
–gpu-memory-utilization 0.85 \\
–max-num-seqs 256 \\
–enable-prefix-caching \\
–no-enable-flashinfer-autotune \\
–enable-auto-tool-choice \\
–tool-call-parser qwen3_xml \\
–reasoning-parser qwen3
这里有一个容易踩坑的点:官方配方明确指出,H200 上不能直接使用普通 TP8 加载该 FP8 权重,需要启用专家并行,即 TEP8。
如果加载阶段 OOM,可以依次检查:
路线二:想在算家云(suanjiayun.com) 尽快跑起来,先部署 Qwen3.8-27B
如果目标是今天完成 Qwen3.8 API 验证,而不是研究 Flash-Next 架构,更现实的选择是 Qwen3.8-27B。
vLLM 官方配方已经验证:
- 2×RTX 5090 可以运行 Qwen3.8-27B 的 FP8 或 NVFP4 版本;
- 1×RTX 5090 可以运行 NVFP4,但需要降低上下文并增加 –enforce-eager;
- 双卡配置更适合保留长上下文和 KV Cache 空间。
算家云当前官网列出了 32GB 显存的 RTX 5090。实际库存、区域和可选卡数会动态变化,应以创建实例页面为准。
在算家云创建实例后,先检查运行环境:
nvidia-smi
python -V
python -c "import torch; print(torch.__version__, torch.cuda.is_available())"
如果创建页面提供双 RTX 5090,可以参考以下 FP8 启动方式:
vllm serve Qwen/Qwen3.8-27B-FP8 \\
–tensor-parallel-size 2 \\
–max-model-len 262144 \\
–kv-cache-dtype fp8 \\
–reasoning-parser qwen3 \\
–enable-auto-tool-choice \\
–tool-call-parser qwen3_coder
启动后验证 OpenAI 兼容接口:
curl http://127.0.0.1:8000/v1/chat/completions \\
-H "Content-Type: application/json" \\
-d '{
"model": "Qwen/Qwen3.8-27B-FP8",
"messages": [
{"role": "user", "content": "用 Python 实现一个带重试的异步 HTTP 客户端"}
],
"temperature": 1.0,
"top_p": 0.95,
"max_tokens": 1024
}'
如果服务只返回 <think> 内容,或者答案被推理过程挤占,需要确认启动参数中包含:
–reasoning-parser qwen3
算家云适合放在哪个环节?
算家云更适合承担“按需准备 GPU 环境、下载权重、启动推理服务、完成 API 验收”这段工程流程。
平台支持 SSH、JupyterLab、VS Code 等连接方式;按量实例开机开始计算算力费用,关机结束实例算力计费,不足一小时的使用时段按秒计费。模型权重、数据盘等关联资源是否继续计费,则要分别查看对应规则。
对于 Qwen3.8,建议这样选:
| 快速验证 Qwen3.8 对话、代码和工具调用 | 双 RTX 5090 + Qwen3.8-27B-FP8 |
| 单卡实验 | RTX 5090 + 27B NVFP4,缩短上下文 |
| 研究 Flash-Next 新架构 | 选择官方验证的 H200、B200、GB300 等多卡配置 |
| 生产级高并发 | 先压测吞吐、首 Token 延迟和 KV Cache,再决定 TP/TEP |
| 只是调用模型能力 | 直接使用托管 API,避免维护推理基础设施 |
FAQ
Qwen3.8-Flash-Next 是 6B 模型吗?
不是。它的主模型为 125B 参数,每个 Token 激活约 6B,此外还有 51B N-gram Embedding 和 MTP 参数。
一张 RTX 5090 能运行 Flash-Next FP8 吗?
不能按官方 FP8 权重直接加载。FP8 checkpoint 为 172.78 GiB,远超单张 RTX 5090 的 32GB 显存。
为什么推荐在算家云先跑 Qwen3.8-27B?
因为 27B 已有双 RTX 5090 的 vLLM 验证记录,工程门槛明显低于 Flash-Next,更适合快速完成 API 和业务效果验证。
Flash-Next 能直接使用 100 万 Token 上下文吗?
原生上下文是 262,144 Token。扩展至 100 万 Token 需要显式启用 YaRN,并重新评估显存占用和短上下文质量。
这篇命令是实测结果吗?
不是。模型规格和启动参数来自 Qwen、vLLM 官方资料;算家云 RTX 5090 规格来自平台页面。正式部署前仍需按实时库存和当前推理框架版本验证。




