欢迎光临
我们一直在努力

GLM-5.3-Flash 开放权重:320B 总参数,只激活 18B

GLM-5.3-Flash 开放权重:320B 总参数,只激活 18B

看到“18B 激活参数”,最容易产生的误会是:这是不是一台普通电脑也能轻松跑的 18B 模型?

不是。

GLM-5.3-Flash 仍有 320B 总参数。18B 说的是每次计算实际参与的参数规模,不是下载体积,也不是显存需求。

这次为什么叫 Flash

Z.ai 在 8 月 26 日发布 GLM-5.3-Flash,并称它是 GLM-5 系列首个原生多模态模型。

模型采用线性注意力与稀疏注意力混合架构:局部信息由线性注意力处理,需要跨长距离查找时再由稀疏注意力检索。配套的 IndexPool 用来降低百万 Token 场景下索引器的缓存和延迟压力。

简单说,它并不是把模型整体缩小,而是尽量减少每一步真正需要计算的部分。

“匿名测试”是个有意思的信号

正式发布前,它曾以 ox-alpha 的名字在 OpenCode 和 OpenRouter 接收真实用户流量。

匿名测试可以减少品牌预期对评价的影响,也能更早暴露真实任务里的问题。但这种流量表现仍不是公开、可复现的基准,不能代替自己的任务集。

尤其是代码和 Agent 场景,最好单独看:

  • 首 Token 等多久;

  • 长输出能维持多快;

  • 缓存命中后能省多少;

  • 图片、视频与长文本混合输入是否稳定;

  • 工具调用出错后能否恢复。

开放权重,不等于轻量部署

GLM-5.3-Flash 提供开放权重入口,这对研究、量化和私有化评测是好事。

但 320B 总参数依然决定了它不是“18B 显存级模型”。本地运行要考虑权重存储、量化精度、KV Cache、并行方式和推理框架支持。把激活参数直接换算成显存,结论会差得很远。

适合怎样试

长仓库、多模态资料和复杂 Agent 任务,可以拿它与现有模型做一次同题对照。测试时别只记“答对没答对”,还要记成本、延迟、工具调用次数和失败恢复。

官方称它以较低价格接近更高档模型,这个方向值得关注;至于能不能成为自己的默认模型,最终还是由真实任务决定。

来源

  • GLM-5.3-Flash 官方发布

  • GLM-5.3-Flash 模型卡

本文为行业资讯整理与原创判断;参数、价格、模型能力和开放状态以原始来源为准。

#AI #GLM #多模态AI #AI编程

赞(0)
未经允许不得转载:171主机测评 » GLM-5.3-Flash 开放权重:320B 总参数,只激活 18B
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址