欢迎光临
我们一直在努力

【Qwen3.8-Max技术解析】2.4T参数如何刷新开源编码与协作模型上限

文章目录

  • Qwen3.8-Max技术解析:2.4T参数如何刷新开源编码与协作模型上限
    • 一、引言
    • 二、参数全景:2.4T 背后是 95B 激活
      • 2.1 官方确认的核心规格
    • 三、编码能力:从写函数转向连续十几天做项目
      • 3.1 自演化 Harness:16 天、265 次提交
      • 3.2 从复现论文到改进论文
      • 3.3 官方基准并非“每项第一”
    • 四、协作能力:模型开始为 Harness 和多 Agent 而训练
      • 4.1 真实工作强化学习
      • 4.2 330 个子 Agent 与 6000 次回测
    • 五、工程接入:API、Codex 与 Qwen Code
    • 六、横向对比:Qwen3.8-Max 的真正位置
    • 七、总结

Qwen3.8-Max技术解析:2.4T参数如何刷新开源编码与协作模型上限

一、引言

亲爱的朋友们,创作不容易,若对您有帮助的话,请点赞收藏加关注哦,您的关注是我持续创作的动力,谢谢大家!有问题请私信或联系邮箱:jasonai.fn@gmail.com

2026 年 8 月 3 日,阿里通义千问正式上线 Qwen3.8-Max。它拥有 2.4 万亿总参数、950 亿激活参数和 100 万 Token 上下文,是 Qwen 家族迄今能力最强的模型,也是阿里首次宣布开放 Max 级模型权重。

但“发布”和“开源”需要分开理解:Qwen3.8-Max 已可通过 QwenCloud API 使用,官方计划在发布后一周开放权重。因此,发布当天更准确的描述是:首个确认开源计划的 Qwen Max 级模型已经上线,开放权重仍需等待实际仓库、许可证与文件落地。

它真正值得关注的也不只是 2.4T。Qwen 团队把训练目标从“回答一道题”推向“在真实工作环境里持续数天,把复杂任务变成可验收交付物”。编码、办公、研究、视觉操作与多 Agent 协作,被放进了同一套长程任务能力中。 在这里插入图片描述


二、参数全景:2.4T 背后是 95B 激活

2.1 官方确认的核心规格

维度Qwen3.8-Max
发布时间 2026 年 8 月 3 日
总参数量 2.4T,即 2.4 万亿
单次激活参数 95B,即 950 亿
架构基础 延续 Qwen3.5 的 MoE 架构基础
上下文窗口 1,000,000 Token
最大输出 官方 Codex/OpenClaw 配置示例标注 65,536 Token
输入模态 文本、图像
当前入口 QwenCloud API
开放权重 官方计划于发布后一周提供
重点能力 Coding、Work、Research、长程任务、多模态 Agent

2.4T 不等于每生成一个 Token 都计算 2.4T 参数。MoE 会根据当前输入选择部分专家,单步激活约 95B 参数。这样既保留超大参数池的知识容量,又把计算量压到可部署范围。

输入 Token


共享注意力与路由器
│ 为不同 Token 选择专家

2.4T 总参数的专家池
│ 每步只激活约 95B

工具调用 / 代码 / 文档 / 多模态输出

不过,稀疏激活并不等于“小模型成本”。2.4T 权重仍对显存容量、跨卡通信、专家负载均衡和推理框架提出很高要求。权重开放后,普通开发者更现实的使用方式仍可能是云 API、量化部署或由推理服务商托管,而不是单机满血运行。


三、编码能力:从写函数转向连续十几天做项目

3.1 自演化 Harness:16 天、265 次提交

Qwen 团队让模型从空目录创建 oh-my-cli,并运行一个能够吸收用户反馈、自测结果与社区实践的自演化 Harness。截至 2026 年 7 月 30 日,官方记录给出的结果是:

指标结果
连续自主运行 约 16 天
Git commits 265
Pull Requests 127
Issues 151
自动验证 Build、Unit Test、E2E、Desktop Lifecycle
任务状态 ready -> leased -> active,异常可回流修复

这类案例的重点不是提交次数,而是 Agent Harness 能否闭环:需求先被规范成 Issue,调度器分配任务,Agent 写代码并执行测试,监控器发现异常后再把问题送回修复队列。模型能力与工程外壳缺一不可。

3.2 从复现论文到改进论文

在另一项实验中,Qwen3.8-Max 只拿到论文和 GPU,没有初始代码。它连续工作约 125 小时,写出约 7600 行代码,完成 1100 多次操作与 33 轮 GPU 训练,先复现论文的六项主要发现,再提出并验证 18 个改进思路。

最终方案在 AIME24 上从复现基线的 49.58% 提升到 52.29%,增加 2.71 个百分点。这个过程呈现了研究 Agent 的基本循环:

阅读论文 -> 搭建数据与训练管线 -> 复现实验
▲ │
└── 分析失败 <- 运行验证 <- 形成新假设

需要注意,这些数据来自 Qwen 官方案例,不等同于第三方审计。真正的价值在于项目轨迹和代码可供社区检查,而不是只看一张跑分图。

3.3 官方基准并非“每项第一”

Coding Agent 基准Qwen3.7-MaxQwen3.8-Max官方表中最高分
Terminal Bench 2.1 74.5 86.6 GPT-5.6 Sol:88.8
SWE-bench Pro 60.6 67.7 Fable 5:80.0
DeepSWE 1.1 21.6 56.6 GPT-5.6 Sol:73.0
FrontierSWE 40.7 73.5 Fable 5:88.8

这张表给“开源最强”加了一条必要限定:Qwen3.8-Max 在官方测试中实现了大幅代际提升,并进入前沿梯队,但没有包揽所有编码榜首。它的竞争力更集中在 开放权重计划、超长上下文、多 Harness 适配和长程交付能力的组合。


四、协作能力:模型开始为 Harness 和多 Agent 而训练

4.1 真实工作强化学习

Qwen3.8-Max 的协作能力来自三条同时扩展的轴:

扩展轴从什么走向什么解决的问题
Task 单任务 -> 多任务 -> 多日任务 模型能否持续推进
Workspace 单文件 -> 多文件 -> 异构目录 模型能否理解真实项目
Harness 单一工具 -> 多版本、多技能、多客户端 模型能否跨工作台稳定执行

官方说明提到,训练覆盖 QwenWork、Claude Code、Codex、OpenClaw 和 Hermes 等 Harness,并使用统一奖励系统同时评估代码执行、文本质量、渲染后的视觉结果和 Agent 检查结果。

这意味着“协作模型”不是一句人格设定。模型需要学会拆任务、把任务变成可执行工作流、调度子 Agent、根据真实工具反馈改计划,并对最终产物负责。

4.2 330 个子 Agent 与 6000 次回测

在量化研究案例中,Qwen3.8-Max 将六类因子描述拆成约 300 个研究方向,调度约 330 个子 Agent,完成约 6000 次回测,并在运行中根据结果修改工作流。

主 Agent:定义目标、约束、验收标准
├── 子 Agent 组 A:动量因子
├── 子 Agent 组 B:价值因子
├── 子 Agent 组 C:质量与投资因子
├── 子 Agent 组 D:低风险与情绪因子
└── 验证层:回测、去冗余、多种子验证、汇总

这类大规模协作的瓶颈会从“模型聪不聪明”转向“任务是否独立、状态是否持久、结果是否可验证”。没有数据隔离、停止条件和统一验收,更多子 Agent 只会更快地产生更多噪声。


五、工程接入:API、Codex 与 Qwen Code

Qwen 官方给出了 QwenCloud、Claude Code、Codex、Qoder CLI、Qwen Code 与 OpenClaw 等接入方式。以 OpenAI 兼容接口为例:

from openai import OpenAI

client = OpenAI(
api_key="<your_qwencloud_api_key>",
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

response = client.responses.create(
model="qwen3.8-max",
input="Inspect this repository, propose a plan, implement the fix, and run tests.",
)

print(response.output_text)

生产接入不应只验证“API 能返回文本”,还要观察:

检查项原因
工具调用兼容性 不同 Harness 对 Responses、流式事件和并行工具调用的实现不同
长上下文有效性 100 万窗口不代表所有信息都能被同等准确地检索
费用与速率限制 长程 Agent 会产生大量输入回放和工具结果
中断与恢复 多日任务必须保存检查点,不能依赖一个永不掉线的会话
权限与沙盒 自主时间越长,错误写入、凭据泄露和资源失控风险越高
许可证 权重开放后仍要确认具体许可证和商用边界

六、横向对比:Qwen3.8-Max 的真正位置

维度Qwen3.8-Max顶级闭源模型中小型开源模型
权重可得性 已宣布一周后开放,发布日尚未落地 通常不开放 已可下载
规模 2.4T 总参数、95B 激活 参数通常不披露 更容易本地部署
编码 前沿梯队,部分公开基准仍落后领先闭源模型 单项能力强、生态成熟 成本低、可定制
长程协作 官方重点,强调多日任务和多 Harness 产品化与工具链较成熟 取决于外部 Agent 框架
上下文 100 万 Token 因模型而异 通常更短
私有化 权重开放后具备可能性,但部署门槛高 主要通过 API 最容易落地
验证状态 官方案例丰富,仍需更多独立复测 第三方评测较多 社区可直接审计

Qwen3.8-Max 的生态位不是“用一个榜单证明所有能力第一”,而是把接近闭源前沿的编码与协作能力,放进一个计划开放权重、可跨 Harness 使用的 Max 级模型中。对企业而言,这提供了 API 托管与未来私有化之间的选择空间。


七、总结

维度核心判断
参数 2.4T 总参数、95B 激活,体现超大规模 MoE 路线
编码 从函数生成跨到多日项目、自测、研究复现与持续修复
协作 训练目标覆盖多 Harness、多 Agent 和真实交付物
开源 是首个宣布开放权重的 Qwen Max 级模型,但发布日权重尚未落地
风险 官方案例需独立复核,部署成本、许可证和长程权限仍待验证

Qwen3.8-Max 代表的变化是:开源模型的竞争单位正在从“一个权重文件”升级为“模型 + Harness + 工具 + 验证循环”。 2.4T 决定能力上限,95B 激活决定计算现实,而能否在十几天后仍保持目标、恢复错误并交付可用结果,才决定它是否真的适合下一代 Agent 工作流。

参考资料:

  • Qwen3.8-Max: A New Bar for Coding and Cowork — Qwen Team,2026-08-03
  • qwen-code-dev-bot/oh-my-cli — GitHub
  • Qwen3.8-Max 正式发布:2.4T 规模,自主编程 16 天完成 Hermes Agent — InfoQ

  • 赞(0)
    未经允许不得转载:171主机测评 » 【Qwen3.8-Max技术解析】2.4T参数如何刷新开源编码与协作模型上限
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址