写在前面

欢迎大家关注Rocky的公众号:WeThinkIn 欢迎大家关注Rocky的知乎:Rocky Ding AIGC算法工程师/开发工程师面试面经秘籍分享:WeThinkIn/Interview-for-Algorithm-Engineer欢迎大家Star~
AIGC时代的 《三年面试五年模拟》AI算法工程师/开发工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍
Rocky最新撰写AI Agent(AI智能体)的深入浅出全维度解析文章: 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/33pJ0
大家好,我是Rocky。
核心导读
这篇 GLM-5 技术报告真正值得读的地方,并不是“又一个大模型刷新了一堆榜单”,而是它把 AI Coding 的叙事从 Vibe Coding 往前推了一步:模型不再只是帮人写一段代码、改一个函数、补一个测试,而是开始被训练成可以在真实工程环境里规划、调用工具、运行测试、修复错误、跨多轮保持上下文的工程执行系统。
Rocky认为,GLM-5 的关键词不是 Coding,而是 Engineering。Vibe Coding 解决的是“人类用自然语言驱动模型生成代码”的体验问题;Agentic Engineering 解决的是“模型能不能在一个真实工程闭环里持续交付结果”的系统问题。前者更像创作工具,后者更像生产关系的变化。
论文的核心事实可以压缩成五点:
O
(
L
2
)
O(L^2)
O(L2) 转向内容相关的动态稀疏选择,目标是在保持长上下文保真度的同时降低训练与推理成本。
这篇报告的中心判断是:GLM-5 试图证明,下一阶段 AI Coding 的竞争,不只是模型会不会写代码,而是谁能把模型训练、推理、工具、环境、验证器和硬件部署组织成一个可持续迭代的工程系统。
这句话听起来很宏大,但落到工程里很具体。真实软件开发不是一次生成,而是读仓库、定位文件、理解需求、修改代码、运行测试、看日志、修复回归、跨多个 commit 保持一致性。一个模型如果只会生成漂亮代码片段,它仍然停留在 Vibe Coding;只有当它能在执行环境里不断校正自己,它才开始接近 Agentic Engineering。

图 1 是论文开篇放出的结果图:GLM-5 在 Humanity’s Last Exam、SWE-bench Verified、SWE-bench Multilingual、Terminal-Bench 2.0、BrowseComp、MCP-Atlas、
τ
2
\\tau^2
τ2-Bench、Vending Bench 2 等 8 个 agentic、reasoning、coding 基准上与 DeepSeek-V3.2、Claude Opus 4.5、Gemini 3 Pro、GPT-5.2 进行比较。Rocky认为,这张图的意义不只是“GLM-5 进了前沿模型区间”,而是它选的评测集合已经明显从静态问答转向“模型是否能执行任务”。
问题背景:作者到底想解决什么
过去两年的 AI Coding 有一个非常明显的阶段变化。
第一阶段是代码补全。模型像一个更强的 Copilot,帮开发者补函数、写样板代码、解释报错。
第二阶段是 Vibe Coding。用户不再精确描述每一行实现,而是用自然语言描述产品意图、界面感觉、交互目标,模型生成一个可运行原型。这个阶段把软件生产门槛大幅降低,但也带来一个问题:原型很快,交付很慢。模型能写第一版,但经常在复杂工程、测试回归、长期维护上失控。
第三阶段就是 GLM-5 报告所说的 Agentic Engineering。它关心的不再只是“写出来”,而是“能否在真实工程约束下交付”。这里的约束包括长上下文代码库、工具调用、终端环境、多轮任务、单元测试、GUI 交互、依赖安装、错误日志、上下文管理、部署硬件和推理成本。
论文的出发点很清楚:随着 LLM 从被动知识库变成主动问题解决者,计算成本与真实世界适应性成为主要瓶颈。GLM-5 试图同时解决两个问题:
Rocky认为,这个问题切得很准。AI Coding 真正进入产业后,瓶颈不会只在“模型能不能生成更聪明的代码”,而在“模型能不能稳定通过真实工程闭环”。这也是为什么论文标题没有停留在 Coding,而是写成 Agentic Engineering。
核心思路:用一句主线串起来
GLM-5 的方法主线可以概括为:
用 DSA 和训练系统工程降低长上下文成本,用大规模 agent/coding 数据把模型放进真实任务分布,再用异步 Agentic RL 和可验证环境把“生成代码”训练成“执行工程任务”。
这条主线里有四个关键环节。
第一,基础模型要能承载长上下文和高强度推理。GLM-5 使用 MoE 扩容到 744B 总参数,同时用 DSA 降低长上下文注意力成本,并通过 28.5T tokens 训练预算强化代码、推理和长文档能力。
第二,数据分布要从代码片段走向工程轨迹。报告中反复强调 issue-PR pairs、repo-level code files、commit diffs、relevant source files、agent trajectories、terminal environments。真正的代码能力不是 HumanEval 那种短函数,而是从真实仓库状态中完成修改。
第三,后训练要从单轮偏好优化走向多阶段 RL。GLM-5 的后训练不是一个统一 RL,而是 Reasoning RL、Agentic RL、General RL,再用 On-Policy Cross-Stage Distillation 修复能力回退。
第四,评测要从静态榜单走向执行闭环。CC-Bench-V2、Agent-as-a-Judge、SWE-rebench、Vending-Bench 2 都在试图回答同一个问题:模型在真实或接近真实的工作流里,是否能持续完成任务。
这就是 Rocky 对这篇论文的核心解读:GLM-5 不是单点模型报告,而是一份“AI 工程执行系统”的训练与评测蓝图。
方法展开:沿着论文原始逻辑拆解
从 ARC 到 Agentic Engineering:目标函数变了
GLM-4.5 已经强调 Agentic、Reasoning、Coding 三类能力,即 ARC。GLM-5 延续这个方向,但进一步把目标推向工程级执行。

图 2 展示 GLM-5 在 Artificial Analysis Intelligence Index v4.0 中达到 50 分,成为论文所称的 open weights leader。这个指数包含 GDPval-AA、
τ
2
\\tau^2
τ2-Bench Telecom、Terminal-Bench Hard、SciCode、AA-LCR、AA-Omniscience、IFBench、Humanity’s Last Exam、GPQA Diamond、CritPt 等 10 个评测。
这里的信号是:模型能力评价正在从单纯知识/推理题,转向综合任务、经济价值任务、终端操作、科学代码、幻觉控制和指令遵循。Rocky认为,这种评测转向比单个分数更重要。因为 AI Agent 如果要进入真实生产环境,最终被衡量的是任务完成率、可靠性、成本和可控性,而不是只在一个学术 benchmark 上赢几分。

图 3 进一步补充了人类偏好侧的证据:GLM-5 在 LMArena 的 Text Arena 和 Code Arena 中成为排名靠前的开放模型。LMArena 的价值在于它来自大量真实用户交互,而不是研究者预先构造的固定题集。但它也有边界:arena 分数反映人类偏好和即时体验,不等于完整工程交付能力。

图 4 是这篇论文最接近 Agent 未来方向的图之一。Vending-Bench 2 测试模型在一年模拟经营中的长期一致性,CC-Bench-V2 则测试前端、后端、长时程工程任务。GLM-5 在 Vending-Bench 2 中以 $4,432 结束模拟账户,在开源模型中排名靠前;在 CC-Bench-V2 中相比 GLM-4.7 明显提升,但距离 Claude Opus 4.5 在一些完整任务成功率上仍有差距。
这个差距很重要。它说明 Agentic Engineering 不是简单堆模型规模就能解决。长时程任务的难点在于错误会累积、上下文会漂移、子任务之间会相互影响。单点能力强,不等于长期执行稳定。
训练总管线:从大规模预训练到多阶段 RL

图 5 是 GLM-5 的训练总图。论文将训练分成三层:
这套流程真正体现的是“能力不是一次训练出来的”。预训练提供知识和代码底座,mid-training 让模型适应长上下文和 agent 数据,SFT 让模型进入可控对话与工具调用格式,RL 把可验证任务中的行为放大,cross-stage distillation 防止不同阶段互相覆盖。
Rocky认为,这种多阶段训练其实很像复杂产品研发。第一版是基础能力,第二版是场景适配,第三版是反馈闭环,第四版是稳定性和可维护性。模型训练正在越来越像软件工程本身。
架构:744B MoE、MLA、MTP 与 DSA 的效率组合
GLM-5 的模型规模是 744B 总参数、40B 激活参数,采用 256 experts、80 层结构。和 GLM-4.5 相比,总参数翻倍以上,但激活参数只从 32B 增至 40B。这个设计延续 MoE 的基本逻辑:扩大容量,但控制每次推理激活成本。
论文在注意力结构上讨论了 MLA 与 GQA 的权衡。MLA 通过压缩 key-value vectors 带来更好的 KV cache memory efficiency,但在作者实验中,直接使用 576 维 latent KV-cache 的 MLA 不如 GQA-8。为此,GLM-5 提出 Muon Split:把多头 query/key/value 的 up-projection 矩阵拆成更小的 head-specific 矩阵,分别做矩阵正交化,使不同 attention heads 能以不同尺度更新。
表 1:GQA-8 与 MLA 变体对比
| GQA-8 | 77.3 | 61.2 | 60.0 | 79.6 | 53.3 | 47.6 | 38.5 |
| MLA | 77.3 | 61.5 | 59.7 | 77.8 | 48.9 | 46.2 | 33.5 |
| MLA + Muon Split | 77.8 | 62.5 | 62.1 | 79.9 | 51.8 | 45.0 | 36.7 |
| MLA-256 + Muon Split | 77.4 | 62.0 | 59.9 | 79.6 | 51.3 | 47.5 | 36.6 |
另一个效率点是 Multi-token Prediction with Parameter Sharing。GLM-5 训练时共享 3 个 MTP layers 的参数,以在不增加 draft model memory cost 的情况下提升 speculative decoding 接受长度。论文报告在私有 prompt set 上,同样 speculative steps 为 4 时,GLM-5 accept length 为 2.76,高于 DeepSeek-V3.2 的 2.55。
表 2:DeepSeek-V3.2 与 GLM-5 的 accept length
| DeepSeek-V3.2 | 2.55 |
| GLM-5 | 2.76 |
这些结构并不直接决定 Agent 能力,但它们决定一个现实问题:长上下文、大模型、多轮 rollout 是否跑得起。Agentic Engineering 不是只需要聪明,还需要吞吐、延迟、显存、KV cache 和硬件适配。
DSA:长上下文不是越密越好,而是要把注意力变成稀缺资源
GLM-5 采用 DeepSeek Sparse Attention。论文对 DSA 的解释很直接:传统 dense attention 在 128K 上下文中成本接近不可承受,而 DSA 用动态、细粒度选择机制,让模型根据内容决定哪些 token 值得关注。
表 3:MLA 与 DSA base model 的长上下文对比
| MLA | 100.0 | 95.5 | 79.7 | 66.3 |
| DSA | 100.0 | 97.0 | 86.0 | 63.0 |
作者声称 DSA 在长序列上可以减少约 1.5 到 2 倍注意力计算,对 128K agent 推理非常重要。DSA 的训练不是从零开始,而是从 dense base model 进行 continued pre-training,采用 dense warm-up 和 sparse adaptation 两阶段,避免从头训练的巨大成本。

图 6 用 SFT loss 对比 MLA 和 DSA 的适配效果。论文的结论是:经过 DSA adaptation 后,DSA 与 MLA 在训练 loss 和评测上基本打平,同时获得长上下文效率优势。
论文还比较了 SWA、GDN、SimpleGDN 等 efficient attention 变体。一个重要发现是,朴素 interleaved SWA 在长上下文任务上会灾难性下降,例如 RULER@128K 从 full attention 的 75.28 掉到 6.51;search-based SWA 能改善但仍有差距;DSA 因为索引器做 token-level sparse selection,被作者视为更接近“无损”的路径。
表 4:RULER 上 GLM-9B baseline 与 SWA 变体
| GLM-9B Full Attention | 95.19 | 93.67 | 92.01 | 91.09 | 85.35 | 75.28 |
| SWA Interleave | 94.87 | 54.02 | 25.89 | 12.61 | 8.32 | 6.51 |
| SWA Pattern | 95.78 | 92.54 | 88.92 | 82.52 | 70.23 | 53.95 |
表 5:长上下文 benchmark 中 efficient attention 的取舍
| Full Attention baseline | 85.35 / 75.28 | 69.00 / 65.83 | 质量基准,但成本最高 |
| SWA Interleave | 8.32 / 6.51 | 50.33 / 39.33 | 固定窗口模式丢失长程依赖 |
| SWA Pattern | 70.23 / 53.95 | 62.33 / 51.17 | 搜索层选择改善明显,但仍有损失 |
| GDN | 79.66 / 70.91 | 65.50 / 56.17 | 质量更好,但引入额外参数 |
| SimpleGDN | 82.11 / 69.59 | 65.50 / 58.50 | 更好复用预训练权重,但仍非无损 |
表 6:GLM-4.7-Flash 上 DSA warmup/full training 的 RULER 对比
| GLM-4.7-Flash | 97.44 | 96.72 | 95.83 | 92.96 | 85.34 | 79.21 |
| GLM-4.7-Flash + DSA warmup | 97.51 | 96.54 | 95.40 | 90.09 | 84.05 | 71.35 |
| GLM-4.7-Flash + DSA | 96.77 | 96.25 | 96.69 | 93.45 | 87.06 | 78.86 |
Rocky认为,DSA 的本质不是“省算力”这么简单,而是把 long-context attention 从平均分配资源,变成动态分配资源。对 Agent 来说,长上下文不是越长越好,真正重要的是在 100K 甚至 200K token 中找到当前动作真正相关的证据。
Mid-training:让模型进入长上下文工程分布
GLM-5 的 mid-training 逐步扩展上下文:32K 阶段使用 1T tokens,128K 阶段使用 500B tokens,200K 阶段使用 50B tokens。相比 GLM-4.5 的 128K 上限,额外 200K 阶段用于增强超长文档、复杂多文件代码库和长时程 agent 轨迹。
软件工程数据是这里的关键。论文保留 repo-level code files、commit diffs、GitHub issues、pull requests、relevant source files 拼接成统一训练序列的范式,并放宽 repository-level filtering 以扩大仓库池,同时加强 issue-level 过滤。过滤后 issue-PR 数据约 160B unique tokens。
这和传统代码模型差别很大。传统代码模型学“代码文本”,而 agentic engineering 模型要学“工程状态转移”:issue 是什么,相关文件在哪里,diff 怎么形成,测试如何通过,PR 如何收敛。Rocky认为,这正是 AI Coding 从 demo 走向生产的分界线。
SFT:从单次回答到三种 thinking 模式
GLM-5 的 SFT 数据覆盖 General Chat、Reasoning、Coding & Agent 三类。报告中特别强调,模型最大上下文扩展到 202,752 tokens,并支持三种 thinking 特性:

图 7 解释了这三种思考模式为什么重要。真实工程任务不是一问一答,而是“读代码 – 调工具 – 看结果 – 再推理 – 再修改”的循环。如果每轮都丢失前面的 reasoning,模型会在长任务中反复自我重构,容易产生不一致。Preserved Thinking 的产品含义,是把推理状态变成 agent 长时程执行的一部分。
Rocky认为,这个方向会越来越重要。未来 AI Coding 工具的核心体验,不只是模型能不能想,而是系统能不能管理模型的 thinking 成本、可见性、持久性和安全边界。
Reasoning RL:IcePop、DSA 稳定性和混合领域训练
GLM-5 的 Reasoning RL 基于 GRPO,并加入 IcePop 来处理 training-inference mismatch。论文显式区分 training policy
π
train
\\pi^{\\text{train}}
πtrain 和 inference policy
π
infer
\\pi^{\\text{infer}}
πinfer,因为 rollout 采样时的分布和训练更新时的分布并不完全一致。
公式(1):GLM-5 的 Reasoning RL 优化目标
L
(
θ
)
=
−
E
x
∼
D
,
{
y
i
}
i
=
1
G
∼
π
θ
old
infer
(
⋅
∣
x
)
[
1
G
∑
i
=
1
G
1
∣
y
i
∣
∑
t
=
1
∣
y
i
∣
pop
(
ρ
i
,
t
,
1
/
β
,
β
)
min
(
r
i
,
t
A
^
i
,
t
,
clip
(
r
i
,
t
,
1
−
ϵ
low
,
1
+
ϵ
high
)
A
^
i
,
t
)
]
\\mathcal{L}(\\theta)= -\\mathbb{E}_{x\\sim\\mathcal{D},\\{y_i\\}_{i=1}^{G}\\sim\\pi^{\\text{infer}}_{\\theta_{\\text{old}}}(\\cdot\\mid x)} \\left[ \\frac{1}{G}\\sum_{i=1}^{G} \\frac{1}{|y_i|}\\sum_{t=1}^{|y_i|} \\operatorname{pop}(\\rho_{i,t},1/\\beta,\\beta) \\min\\left( r_{i,t}\\hat{A}_{i,t}, \\operatorname{clip}(r_{i,t},1-\\epsilon_{\\text{low}},1+\\epsilon_{\\text{high}})\\hat{A}_{i,t} \\right) \\right]
L(θ)=−Ex∼D,{yi}i=1G∼πθoldinfer(⋅∣x)
G1i=1∑G∣yi∣1t=1∑∣yi∣pop(ρi,t,1/β,β)min(ri,tA^i,t,clip(ri,t,1−ϵlow,1+ϵhigh)A^i,t)
公式(2):training-inference mismatch ratio
ρ
i
,
t
=
π
θ
old
train
(
y
i
,
t
∣
x
,
y
i
,
<
t
)
π
θ
old
infer
(
y
i
,
t
∣
x
,
y
i
,
<
t
)
\\rho_{i,t}= \\frac{ \\pi_{\\theta_{\\text{old}}}^{\\text{train}}(y_{i,t}\\mid x,y_{i,<t}) }{ \\pi_{\\theta_{\\text{old}}}^{\\text{infer}}(y_{i,t}\\mid x,y_{i,<t}) }
ρi,t=πθoldinfer(yi,t∣x,yi,<t)πθoldtrain(yi,t∣x,yi,<t)
公式(3):pop operator
pop
(
ρ
i
,
t
,
1
/
β
,
β
)
=
{
ρ
i
,
t
,
1
/
β
≤
ρ
i
,
t
≤
β
0
,
otherwise
\\operatorname{pop}(\\rho_{i,t},1/\\beta,\\beta)= \\begin{cases} \\rho_{i,t}, & 1/\\beta \\le \\rho_{i,t} \\le \\beta \\\\ 0, & \\text{otherwise} \\end{cases}
pop(ρi,t,1/β,β)={ρi,t,0,1/β≤ρi,t≤βotherwise
公式(4):PPO-style importance ratio 与 group-normalized advantage
r
i
,
t
=
π
θ
train
(
y
i
,
t
∣
x
,
y
i
,
<
t
)
π
θ
old
train
(
y
i
,
t
∣
x
,
y
i
,
<
t
)
,
A
^
i
,
t
=
R
i
−
mean
(
R
1
,
…
,
R
G
)
std
(
R
1
,
…
,
R
G
)
r_{i,t}= \\frac{ \\pi_{\\theta}^{\\text{train}}(y_{i,t}\\mid x,y_{i,<t}) }{ \\pi_{\\theta_{\\text{old}}}^{\\text{train}}(y_{i,t}\\mid x,y_{i,<t}) }, \\quad \\hat{A}_{i,t}= \\frac{ R_i-\\operatorname{mean}(R_1,\\ldots,R_G) }{ \\operatorname{std}(R_1,\\ldots,R_G) }
ri,t=πθoldtrain(yi,t∣x,yi,<t)πθtrain(yi,t∣x,yi,<t),A^i,t=std(R1,…,RG)Ri−mean(R1,…,RG)
论文报告训练中使用
β
=
2
\\beta=2
β=2、
ϵ
low
=
0.2
\\epsilon_{\\text{low}}=0.2
ϵlow=0.2、
ϵ
high
=
0.28
\\epsilon_{\\text{high}}=0.28
ϵhigh=0.28,group size 为 32,batch size 为 32。
这里的重点不是公式本身,而是 RL 稳定性。GLM-5 在 DSA 架构上做大规模 RL 时发现,DSA indexer 的 top-k 检索结果会影响训练稳定性。如果使用非确定性 CUDA top-k,RL 几步后可能性能急剧下降并伴随 entropy collapse。作者因此使用更慢但确定性的 torch.topk,并默认冻结 indexer 参数。
这件事很工程,但非常有价值。它说明 Agentic RL 不只是奖励函数设计,也包括底层算子确定性、推理引擎与训练引擎一致性、索引器行为可复现性。AI 工程不是玄学,很多能力差异最终来自这些枯燥的系统细节。
Agentic RL:异步 rollout 与长期任务训练
GLM-5 的 Agentic RL 目标是提升 coding agent 和 search agent 任务。朴素 synchronous RL 在长时程 agent rollout 中会严重浪费 GPU,因为某些 trajectory 很长,导致同步点等待最慢样本。GLM-5 因此构建 fully asynchronous and decoupled RL framework,用 central Multi-Task Rollout Orchestrator 解耦 inference 和 training engines。
为控制异步 off-policy 的训练稳定性,论文提出两个机制:
公式(5):异步 Agent RL 的 token-level clipping objective
L
(
θ
)
=
E
t
[
f
(
r
t
(
θ
)
,
ϵ
l
,
ϵ
h
)
A
^
t
log
π
θ
(
a
t
∣
s
t
)
]
L(\\theta)= \\mathbb{E}_t \\left[ f(r_t(\\theta),\\epsilon_l,\\epsilon_h) \\hat{A}_t \\log\\pi_{\\theta}(a_t\\mid s_t) \\right]
L(θ)=Et[f(rt(θ),ϵl,ϵh)A^tlogπθ(at∣st)]
公式(6):rollout policy 与当前 policy 的 importance ratio
r
t
(
θ
)
=
exp
(
log
π
θ
(
a
t
∣
s
t
)
−
log
π
rollout
(
a
t
∣
s
t
)
)
r_t(\\theta)= \\exp\\left( \\log\\pi_{\\theta}(a_t\\mid s_t) -\\log\\pi_{\\text{rollout}}(a_t\\mid s_t) \\right)
rt(θ)=exp(logπθ(at∣st)−logπrollout(at∣st))
公式(7):双侧截断函数
f
(
x
;
ϵ
ℓ
,
ϵ
h
)
=
{
x
,
if
1
−
ϵ
ℓ
<
x
<
1
+
ϵ
h
0
,
otherwise
f(x;\\epsilon_{\\ell},\\epsilon_h)= \\begin{cases} x, & \\text{if } 1-\\epsilon_{\\ell}<x<1+\\epsilon_h \\\\ 0, & \\text{otherwise} \\end{cases}
f(x;ϵℓ,ϵh)={x,0,if 1−ϵℓ<x<1+ϵhotherwise
此外,论文还记录 rollout 使用的 policy weight version,丢弃过时样本;对 coding-agent sandbox 的环境崩溃做 failure reason 记录,避免把环境问题误当成模型能力问题。
Rocky认为,这些机制是 Agentic Engineering 的真正门槛。做一个 coding demo 很容易,训练一个能在 10K+ SWE environments、terminal tasks、高难度多跳搜索任务中稳定学习的 agent,就需要完整工程基础设施。
Search Agent:上下文管理决定长时程性能
GLM-5 在 BrowseComp 上讨论了 context management。作者发现长上下文超过 100K token 后,模型准确率会显著下降,因此采用 Keep-recent-k 策略:当交互历史超过阈值
k
k
k,只折叠早于最近
k
k
k 轮的工具观察。实验中
k
=
5
k=5
k=5,GLM-5 从 55.3% 提升到 62.0%。
进一步,作者把 keep-recent 与 discard-all 组合成 Hierarchical Context Management:当总上下文超过阈值
T
=
32
k
T=32k
T=32k,丢弃整个 tool-call history 并用新上下文继续。

图 8 展示了不同 compute budgets 下的 BrowseComp 表现。结论是,keep-recent + discard-all 的层级策略达到 75.9,优于只用 discard-all。这里的启发很直接:长上下文不是越塞越多越好,Agent 需要上下文治理。记忆、折叠、遗忘和重启,都会成为 agent 系统设计的一部分。
Slide Generation:奖励设计不是打分,而是防止模型钻空子
论文还用 slide generation 展示 GLM-5 如何把 agentic training 扩展到内容生成工作流。模型在 HTML slide 生成中使用三级 reward:

图 9 展示了 reward hacking:模型可能通过硬截断、操纵 spacing 等方式骗过几何指标。作者通过 grounded runtime rendering 获取属性值,修复可被利用的漏洞,使奖励更接近真实审美目标。
这部分很有现实意义。很多 AI 产品团队以为“给模型一个 reward”就能优化产品体验,但真实情况是,模型会学会 exploit reward。越接近产品闭环,reward design 越像安全工程和测试工程。
适配中国芯片:模型能力必须落到部署现实里
GLM-5 还专门讨论了中国 GPU/NPU 生态适配。论文称团队在华为昇腾、摩尔线程、海光、寒武纪、昆仑芯、沐曦、燧原七类国产芯片平台上做了 full-stack adaptation,并以 Ascend Atlas 系列为例讨论 W4A8 mixed-precision quantization、fusion kernels、vLLM-Ascend/SGLang 优化。
这里最关键的是 W4A8:Attention 和 MLP blocks 用 W8A8,MoE experts 压到 W4A8,以便将 750B 参数 GLM-5 部署到单台 Atlas 800T A3。推理上则通过 Lightning Indexer、Sparse Flash Attention、MLAPO、D2H sampling overlap、RadixCache、Prefix Cache、DP+EP 混合并行、FlashComm、MTP 等手段提高长序列性能。
Rocky认为,这一节的产业意义很强。国产大模型如果只在论文里强,不能在国产硬件上跑得稳、跑得便宜、跑得长,就很难成为产业基础设施。模型能力的终点不是 benchmark,而是可部署性。
实验与证据:结果能支撑到什么程度
ARC 基准:GLM-5 的强项在 Agentic 与 Coding
论文最核心的评测是 ARC benchmarks,覆盖 reasoning/general、coding、agentic 三类任务。
表 7:GLM-5 与开源/闭源前沿模型比较
| HLE | 30.5 | 24.8 | 25.1 | 31.5 | 28.4 | 37.2 | 35.4 |
| HLE w/ Tools | 50.4 | 42.8 | 40.8 | 51.8 | 43.4* | 45.8* | 45.5* |
| AIME 2026 I | 92.7 | 92.9 | 92.7 | 92.5 | 93.3 | 90.6 | N/A |
| HMMT Feb. 2025 | 97.9 | 97.1 | 92.5 | 95.4 | 92.9 | 97.3 | 99.4 |
| HMMT Nov. 2025 | 96.9 | 93.5 | 90.2 | 91.1 | 91.7 | 93.0 | 97.1 |
| IMO-AnswerBench | 82.5 | 82.0 | 78.3 | 81.8 | 78.5 | 83.3 | 86.3 |
| GPQA-Diamond | 86.0 | 85.7 | 82.4 | 87.6 | 87.0 | 91.9 | 92.4 |
| LongBench v2 | 64.5 | 59.1 | 59.8 | 61.0 | 64.4 | 68.2 | 59.8 |
| SWE-bench Verified | 77.8 | 73.8 | 73.1 | 76.8 | 80.9 | 76.2 | 80.0 |
| SWE-bench Multilingual | 73.3 | 66.7 | 70.2 | 73.0 | 77.5 | 65.0 | 72.0 |
| Terminal-Bench 2.0 Terminus-2 | 56.2 / 60.7† | 41.0 | 39.3 | 50.8 | 59.3 | 54.2 | 54.0 |
| Terminal-Bench 2.0 Claude Code | 56.2 / 61.1† | 32.8 | 46.4 | N/A | 57.9 | N/A | N/A |
| CyberGym | 43.2 | 23.5 | 17.3 | 41.3 | 50.6 | 39.9 | N/A |
| BrowseComp | 62.0 | 52.0 | 51.4 | 60.6 | 37.0 | 37.8 | N/A |
| BrowseComp w/ Context Manage | 75.9 | 67.5 | 67.6 | 74.9 | 57.8 | 59.2 | 65.8 |
| BrowseComp-ZH | 72.7 | 66.6 | 65.0 | 62.3 | 62.4 | 66.8 | 76.1 |
|
τ 2 \\tau^2 τ2-Bench |
89.7 | 87.4 | 85.3 | 80.2 | 91.6 | 90.7 | 85.5 |
| MCP-Atlas Public Set | 67.8 | 52.0 | 62.2 | 63.8 | 65.2 | 66.6 | 68.0 |
| Tool-Decathlon | 39.2 | 23.8 | 35.2 | 27.8 | 43.5 | 36.4 | 46.3 |
| Vending-Bench 2 | $4,432 | $2,377 | $1,034 | $1,198 | $4,967 | $5,478 | $3,591 |
| GDPval-AA Elo | 1,409 | 1,198 | 1,195 | 1,288 | 1,400 | 1,201 | 1,462 |
这张表能支撑三个判断。
第一,GLM-5 相比 GLM-4.7 有明显跃迁,尤其在 HLE w/ Tools、Terminal-Bench、BrowseComp、MCP-Atlas、GDPval-AA 等 agentic 指标上。
第二,GLM-5 在开源/open-weight 模型中非常强,尤其 coding/agentic 方向已经接近闭源前沿系统。
第三,它并不是全项领先。GPT-5.2、Gemini 3 Pro、Claude Opus 4.5 在部分 reasoning、SWE、Vending、Tool-Decathlon 上仍然领先。更准确的结论是:GLM-5 进入了前沿工程 agent 能力带,但还没有在所有真实工程闭环中压倒闭源模型。
CC-Bench-V2:从 benchmark 到真实工程体验
论文最值得展开的是 CC-Bench-V2。它不是只看模型能否解一道题,而是评估模型在前端、后端、长时程任务里的 end-to-end engineering experience。

图 10 展示 Agent-as-a-Judge 的评测管线。前端项目先 build,通过静态正确性检查后,再由 autonomous Judge Agent 使用 Playwright 和 bash 工具模拟用户交互,根据 checklist 判断功能是否满足。
论文还做了可靠性验证:抽样 130 个 check-items,让人类专家与 Agent-as-a-Judge 独立打分,二者 point-wise 一致率为 94%;对 8 个前沿模型的 ranking consistency,自动框架与人类专家排名 Spearman correlation 为 85.7%。这说明 Agent-as-a-Judge 不是完美裁判,但已经具备一定可用性。
表 8:CC-Bench-V2 前端、后端、长时程任务结果
| Frontend | HTML | ISR | 38.9 | 35.4 | 52.2 |
| Frontend | HTML | CSR | 76.3 | 64.9 | 82.2 |
| Frontend | React | ISR | 34.6 | 17.2 | 39.7 |
| Frontend | React | CSR | 71.0 | 49.4 | 70.7 |
| Frontend | Vue | ISR | 32.7 | 24.5 | 46.9 |
| Frontend | Vue | CSR | 77.1 | 53.8 | 74.3 |
| Build | React | BSR | 100 | 65.0 | 95.0 |
| Build | Vue | BSR | 100 | 70.0 | 100 |
| Build | Svelte | BSR | 100 | 60.0 | 90.0 |
| Build | Next.js | BSR | 95.0 | 70.0 | 80.0 |
| Backend | Engineering | Pass@1 | 25.8 | 19.6 | 26.9 |
| Long-horizon | Repo Exploration | Pass@1 | 65.6 | 47.8 | 64.5 |
| Long-horizon | Chained Tasks | Pass@1 | 52.3 | 43.0 | 61.6 |
这张表很有意思,因为它同时展示了进步和边界。
GLM-5 的 Build Success Rate 很强,React/Vue/Svelte 都到 100 或接近 100,说明生成可构建项目的基础工程能力很扎实。CSR 在 React/Vue 上甚至接近或超过 Claude Opus 4.5,说明许多细粒度需求可以完成。但 ISR 仍低于 Claude Opus 4.5,说明完整任务“一次全过”的能力还有差距。
这正是 Agentic Engineering 的现实状态:模型能满足很多单项需求,但完整交付要求所有需求同时正确、没有回归、没有隐藏失败。工程不是单点成功率,而是系统成功率。
长时程任务也类似。GLM-5 在 Repo Exploration 上达到 65.6,超过 Claude Opus 4.5 的 64.5,说明它在大仓库语义搜索和文件定位上很强;但 Chained Tasks 为 52.3,低于 Claude Opus 4.5 的 61.6,说明多步骤状态递归、错误累积和上下文一致性仍是难点。
SWE-rebench:静态 benchmark 之外的时间鲁棒性
SWE-bench Verified 已经公开多年,存在污染和过拟合风险。论文因此报告 SWE-rebench,它持续挖掘新的真实 GitHub issue-fixing tasks,用于衡量模型对新软件工程问题的泛化。
表 9:SWE-rebench 2026 年 1 月结果
| Claude Opus 4.6 | 52.9% | 1.06% | 70.8% |
| GPT-5.2 xhigh | 51.7% | 1.21% | 58.3% |
| Claude Sonnet 4.5 | 47.1% | 1.69% | 60.4% |
| Gemini 3 Pro | 46.7% | 2.04% | 58.3% |
| Claude Opus 4.5 | 43.8% | 0.93% | 58.3% |
| GLM-5 | 42.1% | 1.21% | 50.0% |
| GLM-4.7 | 41.3% | 2.12% | 56.3% |
| Kimi K2.5 | 37.9% | 1.21% | 50.0% |
这张表比宣传图更冷静。GLM-5 在 SWE-rebench 上超过 GLM-4.7 和 Kimi K2.5,但低于 Claude Opus 4.5/4.6、GPT-5.2、Gemini 3 Pro。说明在新鲜真实 issue 修复上,GLM-5 已经进入可竞争区间,但还没有完全追平最强闭源 coding agent。
Rocky认为,这样的结果反而让论文更可信。真正工程任务很难,模型报告如果处处碾压,反而需要警惕。GLM-5 的强项是 open-weight 阵营的工程能力跃迁,而不是宣称全面无敌。
真实通用能力:不要让 Agent 能力牺牲用户体验

图 11 展示 GLM-5 在机器翻译、多语言对话、指令遵循、世界知识、工具调用等五类真实通用能力上相比 GLM-4.7 的提升。论文强调,这些能力来自高频用户交互模式,不只是狭义 benchmark。
这部分的意义是防止模型为了 coding/agent 能力变得“偏科”。一个真正可用的 Agent 基座,不能只会执行工程任务,还要能和用户沟通、理解约束、遵守格式、调用工具、处理多语言。Agentic Engineering 的产品形态最终还是面向人,而不是只面对测试集。
这篇工作的边界与可复现性
GLM-5 的技术报告信息量很大,也给出了不少具体训练和评测细节,但仍然有几个边界需要明确。
第一,很多关键数据和环境是内部构建的。比如 CC-Bench-V2、真实通用能力评测、部分 agentic environments、human-authored response anchors、中文芯片适配细节,都无法由外部团队完整复现。论文能说明方法和方向,但不能让社区完全复刻训练过程。
第二,横向比较混合了不同来源与不同协议。ARC 表格中有官方报告、公开记录、内部复评,也有特定 agent framework 和特定 prompt 设置。尤其 Terminal-Bench、MCP-Atlas、BrowseComp 这类 agentic benchmark,对工具、超时、judge prompt、context management 很敏感,分数不能被简单视作绝对公平排名。
第三,Agent-as-a-Judge 虽然有 94% point-wise consistency 和 85.7% ranking correlation,但它仍然是模型裁判,可能继承 judge model 的偏好和盲区。它适合规模化评测,不等于替代所有人工验收。
第四,Agentic Engineering 的长时程能力仍有明显边界。CC-Bench-V2 的 Chained Tasks 与 SWE-rebench 都显示,GLM-5 在多步状态递归、长期一致性、完整任务成功率上仍落后最强闭源系统。Vibe Coding 到 Agentic Engineering 的路还没有走完。
第五,论文的“open weights leader”与“open-source”表述需要谨慎区分。模型权重开放、代码开放、训练数据开放、训练基础设施开放是不同层级的开放。对产业采用来说,权重开放已经有价值,但对科学复现来说还不够。
第六,国产芯片适配是重大工程成果,但论文中很多性能比较仍然是总结性描述。真实部署时,还需要看不同 batch size、context length、并发、成本、稳定性、生态工具链和线上 SLO。
如果继续研究/落地,应该关注什么
1. Agentic Engineering 的核心不是代码生成,而是闭环执行
对开发者和产品团队来说,GLM-5 最值得学习的不是某个榜单分数,而是评测定义。CC-Bench-V2、Agent-as-a-Judge、SWE-rebench、Chained Tasks 都在逼近一个事实:真实软件工程不是生成代码,而是闭环执行。
未来 AI Coding 产品要从“生成得像”转向“交付得稳”。这要求系统拥有:
缺任何一环,都只是更高级的代码生成器。
2. 长上下文不是万金油,context management 会成为产品能力
GLM-5 在 BrowseComp 中显示,简单堆长上下文不够。超过 100K token 后准确率可能下降,需要 keep-recent、discard-all、hierarchical context management 等策略。
这对所有 Agent 产品都有启发。未来不是谁有最长上下文谁赢,而是谁能决定什么该记住、什么该折叠、什么该删除、什么时候重启上下文。记忆管理会成为 Agent 产品的核心能力。
3. 异步 RL 是 Agent 训练的基础设施门槛
长时程 agent rollout 不适合同步训练。轨迹长度差异大、工具调用慢、环境不稳定、reward 稀疏,都会导致 GPU idle 和训练噪声。GLM-5 用异步解耦、TITO、importance clipping、version filtering、sandbox failure filtering 来解决这些问题。
Rocky认为,Agent 时代的 RL 竞争会越来越基础设施化。不是每个团队都能训练 agent,不是因为不会写 reward,而是因为没有足够可验证环境、没有稳定 rollout 系统、没有足够工程能力处理长尾失败。
4. 评测会从“模型答题”转向“系统验收”
GLM-5 报告里最先进的评测思想,是把测试变成系统验收。前端用 Playwright 交互,后端用真实 unit tests,长时程用 PR chain,搜索用 context management,商业任务用 Vending-Bench,工具用 MCP-Atlas。
这会改变 AI 产品开发方式。未来 AI Agent 团队最重要的资产,可能不是 prompt 库,而是 evaluation harness。谁能定义真实任务、自动运行、自动验收、持续回归,谁就能迭代出更可靠的 Agent。
5. 国产大模型的竞争会进入“模型 + 硬件 + 工具链”全栈阶段
GLM-5 对七类中国芯片做 full-stack adaptation,这件事不能只看成部署细节。它意味着国产 AI 基础设施进入深水区:模型架构、稀疏注意力、量化、kernel、推理引擎、KV cache、并行通信都要协同优化。
一级市场和产业落地要看清楚:未来不是只有模型公司,也不是只有芯片公司,而是模型和硬件之间的 co-design 能力会越来越重要。单点技术先进性不等于商业确定性,全栈适配能力才更接近长期壁垒。
术语与概念速查
| Vibe Coding | 用自然语言和感觉驱动代码/应用生成 | GLM-5 要跨越的上一阶段范式 |
| Agentic Engineering | 模型在真实工程环境中规划、执行、验证、迭代 | GLM-5 的核心目标 |
| ARC | Agentic、Reasoning、Coding | GLM 系列强调的三类关键能力 |
| MoE | Mixture-of-Experts | GLM-5 以 744B 总参数、40B 激活参数扩展容量 |
| MLA | Multi-latent Attention | 通过 latent KV 减少 KV cache 成本 |
| Muon Split | 对不同 attention head 的 projection 分开做正交化 | 缓解 MLA 训练表现不足 |
| MTP | Multi-token Prediction | 提高 speculative decoding 接受长度 |
| DSA | DeepSeek Sparse Attention | 动态稀疏注意力,降低长上下文成本 |
| Reasoning RL | 面向数学、科学、代码、工具集成推理的 RL | 强化可验证推理能力 |
| Agentic RL | 面向 coding/search agent 的长时程 RL | 训练模型在环境中执行任务 |
| TITO | Token-in-Token-out gateway | 避免异步 RL 中 re-tokenization mismatch |
| Direct Double-sided Importance Sampling | 异步 off-policy 下的 token-level clipping | 控制 rollout log-probability 偏差 |
| On-Policy Cross-Stage Distillation | 跨阶段教师模型蒸馏 | 减少多阶段 RL 后的能力回退 |
| CC-Bench-V2 | 内部真实工程评测套件 | 覆盖前端、后端、长时程任务 |
| Agent-as-a-Judge | 用自主 Judge Agent 交互验收前端任务 | 规模化自动评测 UI 正确性 |
| SWE-rebench | 持续挖掘新 GitHub issue 修复任务的评测 | 衡量时间鲁棒、去污染的软件工程泛化 |
拓展思考:值得继续扩展研究与思考的创新点
1. 从 Vibe Coding 到 Agentic Engineering,是 AI Coding 的第二曲线
Vibe Coding 让软件生产变得更轻,但它的天然上限是“生成”。Agentic Engineering 的目标是“交付”。两者之间不是词汇升级,而是生产关系变化。
一个只会生成代码的模型,需要人类开发者承担工程闭环;一个能做 Agentic Engineering 的系统,则开始承担部分工程责任。前者是工具,后者接近工作流基础设施。
2. 未来 AI 开发者的核心能力,是定义任务和验收标准
GLM-5 报告反复出现 verifiable environments、unit tests、Agent-as-a-Judge、checklists、reward functions、sandbox failures。这说明模型训练和产品迭代越来越依赖“可验证任务”。
AI 不会尊重一个人熬了多少年,只会放大一个人真正能创造多少价值。未来开发者的价值,会越来越多体现在能否把模糊需求拆成可执行、可验证、可回归的任务。
3. Agent 产品的护城河,不是模型调用,而是环境闭环
很多 Agent 创业项目会被基础模型吸收,原因是只做了一层模型封装,没有真实环境、真实数据、真实验收和持续反馈。GLM-5 这类报告提醒我们:真正的护城河在闭环。
如果一个团队掌握高质量工程任务、可执行环境、自动测试、用户反馈、失败归因和持续训练链路,它就有机会形成模型之外的系统壁垒。
4. 长时程一致性会成为下一代 Agent 的关键难题
GLM-5 在 Chained Tasks 上仍落后 Claude Opus 4.5,说明长时程一致性还没解决。这个问题本质上不是“多给点上下文”这么简单,而是任务状态、决策历史、代码变更、测试反馈和未来步骤之间的因果关系维护。
下一阶段 Agent 研究可能会更关注:
这些都比单轮 code generation 更接近真实软件工程。
5. Rocky 的最终判断:工具红利会退潮,工程闭环会沉淀
GLM-5 这篇报告给 Rocky 最大的启发是:AI Coding 已经从“让不会写代码的人也能写代码”进入“让复杂工程任务被重新组织”的阶段。
工具会迭代,模型会换代,工作流会被重构。单点 prompt 技巧、单个 IDE 插件、单次生成体验,都会很快被更强模型吸收。真正能跨周期留下来的,是对任务、工程、产品、评测、基础设施和商业闭环的理解。
GLM-5 的本质,不是一个更会写代码的大模型,而是一个把 AI Coding 推向工程化执行闭环的信号。
这也是为什么它值得被认真阅读。
推荐阅读
Rocky一直在运营技术交流群(WeThinkIn-技术交流群),这个群的初心主要聚焦于技术话题的讨论与学习,包括但不限于算法,开发,竞赛,科研以及工作求职等。群里有很多人工智能行业的大牛,欢迎大家入群一起学习交流~(请添加小助手微信Jarvis8866,拉你进群~)
1. 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2025年可以说是AI Agent全面落地应用的元年,因此Rocky在持续撰写对AI Agent的全维度解析文章:深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2. 深入浅出完整解析扩散模型DDPM、DDIM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
和Rocky一起学习探究扩散模型的本质原理与和核心基础知识,同时不断跟进扩散模型的最新发展。Rocky在本文中对扩散模型的本质做了全面系统的梳理与讲解:深入浅出完整解析扩散模型DDPM、DDIM、SDE、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
3. 深入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识
https://zhuanlan.zhihu.com/p/1975174691049189562
4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
5. 深入浅出完整解析DeepSeek系列核心基础知识
深入浅出完整解析DeepSeek系列核心基础知识
6、Sora等AI视频大模型的核心原理,核心基础知识,网络结构,经典应用场景,从0到1搭建使用AI视频大模型,从0到1训练自己的AI视频大模型,AI视频大模型性能测评,AI视频领域未来发展等全维度解析文章正式发布!
码字不易,欢迎大家多多点赞:
Sora等AI视频大模型文章地址:深入浅出完整解析Sora、Wan2.1、AnimateDiff、CogVideoX等AI视频大模型核心基础知识
7、Stable Diffusion 3和FLUX.1核心原理,核心基础知识,网络结构,从0到1搭建使用Stable Diffusion 3和FLUX.1进行AI绘画,从0到1上手使用Stable Diffusion 3和FLUX.1训练自己的AI绘画模型,Stable Diffusion 3和FLUX.1性能优化等全维度解析文章正式发布!
码字不易,欢迎大家多多点赞:
Stable Diffusion 3和FLUX.1文章地址:深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识
8、Stable Diffusion XL核心基础知识,网络结构,从0到1搭建使用Stable Diffusion XL进行AI绘画,从0到1上手使用Stable Diffusion XL训练自己的AI绘画模型,AI绘画领域的未来发展等全维度解析文章正式发布!
码字不易,欢迎大家多多点赞:
Stable Diffusion XL文章地址:深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识
9、Stable Diffusion 1.x-2.x核心原理,核心基础知识,网络结构,经典应用场景,从0到1搭建使用Stable Diffusion进行AI绘画,从0到1上手使用Stable Diffusion训练自己的AI绘画模型,Stable Diffusion性能优化等全维度解析文章正式发布!
码字不易,欢迎大家多多点赞:
Stable Diffusion文章地址:深入浅出完整解析Stable Diffusion(SD)核心基础知识
10、ControlNet核心基础知识,核心网络结构,从0到1使用ControlNet进行AI绘画,从0到1训练自己的ControlNet模型,从0到1上手构建ControlNet商业变现应用等全维度解析文章正式发布!
码字不易,欢迎大家多多点赞:
ControlNet文章地址:深入浅出完整解析ControlNet核心基础知识
11、LoRA系列模型核心原理,核心基础知识,从0到1使用LoRA模型进行AI绘画,从0到1上手训练自己的LoRA模型,LoRA变体模型介绍,优质LoRA推荐等全维度解析文章正式发布!
码字不易,欢迎大家多多点赞:
LoRA文章地址:深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识
12、深入浅出完整解析AIGC时代Transformer核心基础知识
在AIGC时代中,Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向,成为AI技术架构大一统与多模态整合的关键核心基座,大有一统“AI江湖”之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析:
Transformer文章地址:深入浅出完整解析AIGC时代Transformer核心基础知识
13、最全面的AIGC面经《手把手教你成为AIGC算法工程师,斩获AIGC算法offer!(2024年版)》文章正式发布!
码字不易,欢迎大家多多点赞:
AIGC面经文章地址:手把手教你成为AIGC算法工程师,斩获AIGC算法offer!
14、50万字大汇总《“三年面试五年模拟”之算法工程师的求职面试“独孤九剑”秘籍》文章正式发布!
码字不易,欢迎大家多多点赞:
算法工程师三年面试五年模拟文章地址:https://zhuanlan.zhihu.com/p/545374303
《三年面试五年模拟》github项目地址(希望大家能多多star):https://github.com/WeThinkIn/Interview-for-Algorithm-Engineer
15、Stable Diffusion WebUI、ComfyUI、Fooocus三大主流AI绘画框架核心知识,从0到1搭建AI绘画框架,从0到1使用AI绘画框架的保姆级教程,深入浅出介绍AI绘画框架的各模块功能,深入浅出介绍AI绘画框架的高阶用法等全维度解析文章正式发布!
码字不易,欢迎大家多多点赞:
AI绘画框架文章地址:深入浅出完整解析主流AI绘画框架(ComfyUI、Stable Diffusion WebUI、Fooocus)核心基础知识
16、GAN网络核心基础知识,网络架构,GAN经典变体模型,经典应用场景,GAN在AIGC时代的商业应用等全维度解析文章正式发布!
码字不易,欢迎大家多多点赞:
GAN网络文章地址:https://zhuanlan.zhihu.com/p/663157306
17. AI算法工程师的《三年面试五年模拟》求职秘籍
AIGC时代的算法工程师的求职面试秘籍(持续更新中)
18. AIGC产业的深度思考与分析
2023年3月21日,微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示,自从1980年首次看到图形用户界面(graphical user interface)以来,以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。
Rocky也认为,AIGC及其生态,会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期,未来随着AIGC的全面落地和深度商用,会深刻改变我们的工作、生活、学习以及交流方式,各行各业都将被重新定义,过程会非常有趣。
那么,在此基础上,我们该如何更好的审视AIGC的未来?我们该如何更好地拥抱AIGC引领的革新?Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点,希望能帮助各位读者对AIGC有一个全面的了解:
深入浅出全面解析AIGC时代核心价值与发展趋势(2025年版)

![[特殊字符]DeepSeek‑Harness(DSH)小白保姆教程-171主机测评](https://www.171host.com/wp-content/uploads/2026/08/20260816085112-6a817a009aabf-220x150.png)
