欢迎光临
我们一直在努力

一文读懂GLM-5:从 Vibe Coding 到 Agentic Engineering核心基础知识

写在前面

图片

欢迎大家关注Rocky的公众号:WeThinkIn 欢迎大家关注Rocky的知乎:Rocky Ding AIGC算法工程师/开发工程师面试面经秘籍分享:WeThinkIn/Interview-for-Algorithm-Engineer欢迎大家Star~

AIGC时代的 《三年面试五年模拟》AI算法工程师/开发工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍

Rocky最新撰写AI Agent(AI智能体)的深入浅出全维度解析文章: 深入浅出完整解析AI Agent(AI智能体)的核心基础知识

AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/33pJ0


大家好,我是Rocky。

核心导读

这篇 GLM-5 技术报告真正值得读的地方,并不是“又一个大模型刷新了一堆榜单”,而是它把 AI Coding 的叙事从 Vibe Coding 往前推了一步:模型不再只是帮人写一段代码、改一个函数、补一个测试,而是开始被训练成可以在真实工程环境里规划、调用工具、运行测试、修复错误、跨多轮保持上下文的工程执行系统。

Rocky认为,GLM-5 的关键词不是 Coding,而是 Engineering。Vibe Coding 解决的是“人类用自然语言驱动模型生成代码”的体验问题;Agentic Engineering 解决的是“模型能不能在一个真实工程闭环里持续交付结果”的系统问题。前者更像创作工具,后者更像生产关系的变化。

论文的核心事实可以压缩成五点:

  • GLM-5 是一个 744B 总参数、40B 激活参数的 MoE 模型,相比 GLM-4.5 的 355B/32B 进一步扩展。
  • 模型训练总 token 预算达到 28.5T,其中基础训练强调代码与推理,mid-training 把上下文扩展到 200K,后训练覆盖 Reasoning RL、Agentic RL、General RL 和 On-Policy Cross-Stage Distillation。
  • 架构上采用 DeepSeek Sparse Attention,使长上下文注意力计算从密集

    O

    (

    L

    2

    )

    O(L^2)

    O(L2) 转向内容相关的动态稀疏选择,目标是在保持长上下文保真度的同时降低训练与推理成本。

  • 后训练上引入异步解耦 RL 基础设施,用 Token-in-Token-out、Direct Double-sided Importance Sampling、DP-aware routing 等机制支撑长时程 agent rollout。
  • 评测上,GLM-5 不只报告 AIME、GPQA、SWE-bench 等静态指标,还重点构建 CC-Bench-V2、Agent-as-a-Judge、SWE-rebench、Vending-Bench 2 等更接近真实工程闭环的评估。
  • 这篇报告的中心判断是:GLM-5 试图证明,下一阶段 AI Coding 的竞争,不只是模型会不会写代码,而是谁能把模型训练、推理、工具、环境、验证器和硬件部署组织成一个可持续迭代的工程系统。

    这句话听起来很宏大,但落到工程里很具体。真实软件开发不是一次生成,而是读仓库、定位文件、理解需求、修改代码、运行测试、看日志、修复回归、跨多个 commit 保持一致性。一个模型如果只会生成漂亮代码片段,它仍然停留在 Vibe Coding;只有当它能在执行环境里不断校正自己,它才开始接近 Agentic Engineering。

    在这里插入图片描述

    图 1 是论文开篇放出的结果图:GLM-5 在 Humanity’s Last Exam、SWE-bench Verified、SWE-bench Multilingual、Terminal-Bench 2.0、BrowseComp、MCP-Atlas、

    τ

    2

    \\tau^2

    τ2-Bench、Vending Bench 2 等 8 个 agentic、reasoning、coding 基准上与 DeepSeek-V3.2、Claude Opus 4.5、Gemini 3 Pro、GPT-5.2 进行比较。Rocky认为,这张图的意义不只是“GLM-5 进了前沿模型区间”,而是它选的评测集合已经明显从静态问答转向“模型是否能执行任务”。

    问题背景:作者到底想解决什么

    过去两年的 AI Coding 有一个非常明显的阶段变化。

    第一阶段是代码补全。模型像一个更强的 Copilot,帮开发者补函数、写样板代码、解释报错。

    第二阶段是 Vibe Coding。用户不再精确描述每一行实现,而是用自然语言描述产品意图、界面感觉、交互目标,模型生成一个可运行原型。这个阶段把软件生产门槛大幅降低,但也带来一个问题:原型很快,交付很慢。模型能写第一版,但经常在复杂工程、测试回归、长期维护上失控。

    第三阶段就是 GLM-5 报告所说的 Agentic Engineering。它关心的不再只是“写出来”,而是“能否在真实工程约束下交付”。这里的约束包括长上下文代码库、工具调用、终端环境、多轮任务、单元测试、GUI 交互、依赖安装、错误日志、上下文管理、部署硬件和推理成本。

    论文的出发点很清楚:随着 LLM 从被动知识库变成主动问题解决者,计算成本与真实世界适应性成为主要瓶颈。GLM-5 试图同时解决两个问题:

  • 效率问题:744B 级别模型要进入长上下文、长时程 agent 场景,密集注意力、rollout 同步、KV cache、硬件通信都会成为成本瓶颈。
  • 执行问题:模型要从回答问题变成完成任务,需要在可验证环境中训练,在动态交互中学习,在真实工程任务中评估。
  • Rocky认为,这个问题切得很准。AI Coding 真正进入产业后,瓶颈不会只在“模型能不能生成更聪明的代码”,而在“模型能不能稳定通过真实工程闭环”。这也是为什么论文标题没有停留在 Coding,而是写成 Agentic Engineering。

    核心思路:用一句主线串起来

    GLM-5 的方法主线可以概括为:

    用 DSA 和训练系统工程降低长上下文成本,用大规模 agent/coding 数据把模型放进真实任务分布,再用异步 Agentic RL 和可验证环境把“生成代码”训练成“执行工程任务”。

    这条主线里有四个关键环节。

    第一,基础模型要能承载长上下文和高强度推理。GLM-5 使用 MoE 扩容到 744B 总参数,同时用 DSA 降低长上下文注意力成本,并通过 28.5T tokens 训练预算强化代码、推理和长文档能力。

    第二,数据分布要从代码片段走向工程轨迹。报告中反复强调 issue-PR pairs、repo-level code files、commit diffs、relevant source files、agent trajectories、terminal environments。真正的代码能力不是 HumanEval 那种短函数,而是从真实仓库状态中完成修改。

    第三,后训练要从单轮偏好优化走向多阶段 RL。GLM-5 的后训练不是一个统一 RL,而是 Reasoning RL、Agentic RL、General RL,再用 On-Policy Cross-Stage Distillation 修复能力回退。

    第四,评测要从静态榜单走向执行闭环。CC-Bench-V2、Agent-as-a-Judge、SWE-rebench、Vending-Bench 2 都在试图回答同一个问题:模型在真实或接近真实的工作流里,是否能持续完成任务。

    这就是 Rocky 对这篇论文的核心解读:GLM-5 不是单点模型报告,而是一份“AI 工程执行系统”的训练与评测蓝图。

    方法展开:沿着论文原始逻辑拆解

    从 ARC 到 Agentic Engineering:目标函数变了

    GLM-4.5 已经强调 Agentic、Reasoning、Coding 三类能力,即 ARC。GLM-5 延续这个方向,但进一步把目标推向工程级执行。

    在这里插入图片描述

    图 2 展示 GLM-5 在 Artificial Analysis Intelligence Index v4.0 中达到 50 分,成为论文所称的 open weights leader。这个指数包含 GDPval-AA、

    τ

    2

    \\tau^2

    τ2-Bench Telecom、Terminal-Bench Hard、SciCode、AA-LCR、AA-Omniscience、IFBench、Humanity’s Last Exam、GPQA Diamond、CritPt 等 10 个评测。

    这里的信号是:模型能力评价正在从单纯知识/推理题,转向综合任务、经济价值任务、终端操作、科学代码、幻觉控制和指令遵循。Rocky认为,这种评测转向比单个分数更重要。因为 AI Agent 如果要进入真实生产环境,最终被衡量的是任务完成率、可靠性、成本和可控性,而不是只在一个学术 benchmark 上赢几分。

    在这里插入图片描述

    图 3 进一步补充了人类偏好侧的证据:GLM-5 在 LMArena 的 Text Arena 和 Code Arena 中成为排名靠前的开放模型。LMArena 的价值在于它来自大量真实用户交互,而不是研究者预先构造的固定题集。但它也有边界:arena 分数反映人类偏好和即时体验,不等于完整工程交付能力。

    在这里插入图片描述

    图 4 是这篇论文最接近 Agent 未来方向的图之一。Vending-Bench 2 测试模型在一年模拟经营中的长期一致性,CC-Bench-V2 则测试前端、后端、长时程工程任务。GLM-5 在 Vending-Bench 2 中以 $4,432 结束模拟账户,在开源模型中排名靠前;在 CC-Bench-V2 中相比 GLM-4.7 明显提升,但距离 Claude Opus 4.5 在一些完整任务成功率上仍有差距。

    这个差距很重要。它说明 Agentic Engineering 不是简单堆模型规模就能解决。长时程任务的难点在于错误会累积、上下文会漂移、子任务之间会相互影响。单点能力强,不等于长期执行稳定。

    训练总管线:从大规模预训练到多阶段 RL

    在这里插入图片描述

    图 5 是 GLM-5 的训练总图。论文将训练分成三层:

  • Pre-training:先用 18T general corpus 和 9T code/reasoning corpus 打基础。
  • Mid-training:引入 1T long code/reasoning data、500B/50B long context & agent data,并把上下文从 32K 推到 128K/200K。
  • Post-training:从 Overall SFT 到 Reasoning RL,再到 Agentic RL、General RL,最后用 On-Policy Cross-Stage Distillation 合并能力。
  • 这套流程真正体现的是“能力不是一次训练出来的”。预训练提供知识和代码底座,mid-training 让模型适应长上下文和 agent 数据,SFT 让模型进入可控对话与工具调用格式,RL 把可验证任务中的行为放大,cross-stage distillation 防止不同阶段互相覆盖。

    Rocky认为,这种多阶段训练其实很像复杂产品研发。第一版是基础能力,第二版是场景适配,第三版是反馈闭环,第四版是稳定性和可维护性。模型训练正在越来越像软件工程本身。

    架构:744B MoE、MLA、MTP 与 DSA 的效率组合

    GLM-5 的模型规模是 744B 总参数、40B 激活参数,采用 256 experts、80 层结构。和 GLM-4.5 相比,总参数翻倍以上,但激活参数只从 32B 增至 40B。这个设计延续 MoE 的基本逻辑:扩大容量,但控制每次推理激活成本。

    论文在注意力结构上讨论了 MLA 与 GQA 的权衡。MLA 通过压缩 key-value vectors 带来更好的 KV cache memory efficiency,但在作者实验中,直接使用 576 维 latent KV-cache 的 MLA 不如 GQA-8。为此,GLM-5 提出 Muon Split:把多头 query/key/value 的 up-projection 矩阵拆成更小的 head-specific 矩阵,分别做矩阵正交化,使不同 attention heads 能以不同尺度更新。

    表 1:GQA-8 与 MLA 变体对比

    DatasetHellaswagMMLUC-EvalRACEBBHGSM8KHumanEval
    GQA-8 77.3 61.2 60.0 79.6 53.3 47.6 38.5
    MLA 77.3 61.5 59.7 77.8 48.9 46.2 33.5
    MLA + Muon Split 77.8 62.5 62.1 79.9 51.8 45.0 36.7
    MLA-256 + Muon Split 77.4 62.0 59.9 79.6 51.3 47.5 36.6

    另一个效率点是 Multi-token Prediction with Parameter Sharing。GLM-5 训练时共享 3 个 MTP layers 的参数,以在不增加 draft model memory cost 的情况下提升 speculative decoding 接受长度。论文报告在私有 prompt set 上,同样 speculative steps 为 4 时,GLM-5 accept length 为 2.76,高于 DeepSeek-V3.2 的 2.55。

    表 2:DeepSeek-V3.2 与 GLM-5 的 accept length

    ModelAccept Length
    DeepSeek-V3.2 2.55
    GLM-5 2.76

    这些结构并不直接决定 Agent 能力,但它们决定一个现实问题:长上下文、大模型、多轮 rollout 是否跑得起。Agentic Engineering 不是只需要聪明,还需要吞吐、延迟、显存、KV cache 和硬件适配。

    DSA:长上下文不是越密越好,而是要把注意力变成稀缺资源

    GLM-5 采用 DeepSeek Sparse Attention。论文对 DSA 的解释很直接:传统 dense attention 在 128K 上下文中成本接近不可承受,而 DSA 用动态、细粒度选择机制,让模型根据内容决定哪些 token 值得关注。

    表 3:MLA 与 DSA base model 的长上下文对比

    ModelMQ-NIAH-128kMV-NIAH-128kSQuAD-128kHotpotQA-128k
    MLA 100.0 95.5 79.7 66.3
    DSA 100.0 97.0 86.0 63.0

    作者声称 DSA 在长序列上可以减少约 1.5 到 2 倍注意力计算,对 128K agent 推理非常重要。DSA 的训练不是从零开始,而是从 dense base model 进行 continued pre-training,采用 dense warm-up 和 sparse adaptation 两阶段,避免从头训练的巨大成本。

    在这里插入图片描述

    图 6 用 SFT loss 对比 MLA 和 DSA 的适配效果。论文的结论是:经过 DSA adaptation 后,DSA 与 MLA 在训练 loss 和评测上基本打平,同时获得长上下文效率优势。

    论文还比较了 SWA、GDN、SimpleGDN 等 efficient attention 变体。一个重要发现是,朴素 interleaved SWA 在长上下文任务上会灾难性下降,例如 RULER@128K 从 full attention 的 75.28 掉到 6.51;search-based SWA 能改善但仍有差距;DSA 因为索引器做 token-level sparse selection,被作者视为更接近“无损”的路径。

    表 4:RULER 上 GLM-9B baseline 与 SWA 变体

    Model4K8K16K32K64K128K
    GLM-9B Full Attention 95.19 93.67 92.01 91.09 85.35 75.28
    SWA Interleave 94.87 54.02 25.89 12.61 8.32 6.51
    SWA Pattern 95.78 92.54 88.92 82.52 70.23 53.95

    表 5:长上下文 benchmark 中 efficient attention 的取舍

    MethodRULER 64K/128KRepoQA 64K/128K关键解释
    Full Attention baseline 85.35 / 75.28 69.00 / 65.83 质量基准,但成本最高
    SWA Interleave 8.32 / 6.51 50.33 / 39.33 固定窗口模式丢失长程依赖
    SWA Pattern 70.23 / 53.95 62.33 / 51.17 搜索层选择改善明显,但仍有损失
    GDN 79.66 / 70.91 65.50 / 56.17 质量更好,但引入额外参数
    SimpleGDN 82.11 / 69.59 65.50 / 58.50 更好复用预训练权重,但仍非无损

    表 6:GLM-4.7-Flash 上 DSA warmup/full training 的 RULER 对比

    Model4K8K16K32K64K128K
    GLM-4.7-Flash 97.44 96.72 95.83 92.96 85.34 79.21
    GLM-4.7-Flash + DSA warmup 97.51 96.54 95.40 90.09 84.05 71.35
    GLM-4.7-Flash + DSA 96.77 96.25 96.69 93.45 87.06 78.86

    Rocky认为,DSA 的本质不是“省算力”这么简单,而是把 long-context attention 从平均分配资源,变成动态分配资源。对 Agent 来说,长上下文不是越长越好,真正重要的是在 100K 甚至 200K token 中找到当前动作真正相关的证据。

    Mid-training:让模型进入长上下文工程分布

    GLM-5 的 mid-training 逐步扩展上下文:32K 阶段使用 1T tokens,128K 阶段使用 500B tokens,200K 阶段使用 50B tokens。相比 GLM-4.5 的 128K 上限,额外 200K 阶段用于增强超长文档、复杂多文件代码库和长时程 agent 轨迹。

    软件工程数据是这里的关键。论文保留 repo-level code files、commit diffs、GitHub issues、pull requests、relevant source files 拼接成统一训练序列的范式,并放宽 repository-level filtering 以扩大仓库池,同时加强 issue-level 过滤。过滤后 issue-PR 数据约 160B unique tokens。

    这和传统代码模型差别很大。传统代码模型学“代码文本”,而 agentic engineering 模型要学“工程状态转移”:issue 是什么,相关文件在哪里,diff 怎么形成,测试如何通过,PR 如何收敛。Rocky认为,这正是 AI Coding 从 demo 走向生产的分界线。

    SFT:从单次回答到三种 thinking 模式

    GLM-5 的 SFT 数据覆盖 General Chat、Reasoning、Coding & Agent 三类。报告中特别强调,模型最大上下文扩展到 202,752 tokens,并支持三种 thinking 特性:

  • Interleaved Thinking:每次 response 和 tool call 前都可以 thinking,提高工具调用和生成质量。
  • Preserved Thinking:在 coding agent 场景中保留多轮 conversation 中的 thinking blocks,减少重新推理带来的不一致。
  • Turn-level Thinking:按轮控制是否启用 thinking,简单任务降成本,复杂任务提高稳定性。
  • 在这里插入图片描述

    图 7 解释了这三种思考模式为什么重要。真实工程任务不是一问一答,而是“读代码 – 调工具 – 看结果 – 再推理 – 再修改”的循环。如果每轮都丢失前面的 reasoning,模型会在长任务中反复自我重构,容易产生不一致。Preserved Thinking 的产品含义,是把推理状态变成 agent 长时程执行的一部分。

    Rocky认为,这个方向会越来越重要。未来 AI Coding 工具的核心体验,不只是模型能不能想,而是系统能不能管理模型的 thinking 成本、可见性、持久性和安全边界。

    Reasoning RL:IcePop、DSA 稳定性和混合领域训练

    GLM-5 的 Reasoning RL 基于 GRPO,并加入 IcePop 来处理 training-inference mismatch。论文显式区分 training policy

    π

    train

    \\pi^{\\text{train}}

    πtrain 和 inference policy

    π

    infer

    \\pi^{\\text{infer}}

    πinfer,因为 rollout 采样时的分布和训练更新时的分布并不完全一致。

    公式(1):GLM-5 的 Reasoning RL 优化目标

    L

    (

    θ

    )

    =

    E

    x

    D

    ,

    {

    y

    i

    }

    i

    =

    1

    G

    π

    θ

    old

    infer

    (

    x

    )

    [

    1

    G

    i

    =

    1

    G

    1

    y

    i

    t

    =

    1

    y

    i

    pop

    (

    ρ

    i

    ,

    t

    ,

    1

    /

    β

    ,

    β

    )

    min

    (

    r

    i

    ,

    t

    A

    ^

    i

    ,

    t

    ,

    clip

    (

    r

    i

    ,

    t

    ,

    1

    ϵ

    low

    ,

    1

    +

    ϵ

    high

    )

    A

    ^

    i

    ,

    t

    )

    ]

    \\mathcal{L}(\\theta)= -\\mathbb{E}_{x\\sim\\mathcal{D},\\{y_i\\}_{i=1}^{G}\\sim\\pi^{\\text{infer}}_{\\theta_{\\text{old}}}(\\cdot\\mid x)} \\left[ \\frac{1}{G}\\sum_{i=1}^{G} \\frac{1}{|y_i|}\\sum_{t=1}^{|y_i|} \\operatorname{pop}(\\rho_{i,t},1/\\beta,\\beta) \\min\\left( r_{i,t}\\hat{A}_{i,t}, \\operatorname{clip}(r_{i,t},1-\\epsilon_{\\text{low}},1+\\epsilon_{\\text{high}})\\hat{A}_{i,t} \\right) \\right]

    L(θ)=ExD,{yi}i=1Gπθoldinfer(x)

    G1i=1Gyi1t=1yipop(ρi,t,1/β,β)min(ri,tA^i,t,clip(ri,t,1ϵlow,1+ϵhigh)A^i,t)

    公式(2):training-inference mismatch ratio

    ρ

    i

    ,

    t

    =

    π

    θ

    old

    train

    (

    y

    i

    ,

    t

    x

    ,

    y

    i

    ,

    <

    t

    )

    π

    θ

    old

    infer

    (

    y

    i

    ,

    t

    x

    ,

    y

    i

    ,

    <

    t

    )

    \\rho_{i,t}= \\frac{ \\pi_{\\theta_{\\text{old}}}^{\\text{train}}(y_{i,t}\\mid x,y_{i,<t}) }{ \\pi_{\\theta_{\\text{old}}}^{\\text{infer}}(y_{i,t}\\mid x,y_{i,<t}) }

    ρi,t=πθoldinfer(yi,tx,yi,<t)πθoldtrain(yi,tx,yi,<t)

    公式(3):pop operator

    pop

    (

    ρ

    i

    ,

    t

    ,

    1

    /

    β

    ,

    β

    )

    =

    {

    ρ

    i

    ,

    t

    ,

    1

    /

    β

    ρ

    i

    ,

    t

    β

    0

    ,

    otherwise

    \\operatorname{pop}(\\rho_{i,t},1/\\beta,\\beta)= \\begin{cases} \\rho_{i,t}, & 1/\\beta \\le \\rho_{i,t} \\le \\beta \\\\ 0, & \\text{otherwise} \\end{cases}

    pop(ρi,t,1/β,β)={ρi,t,0,1/βρi,tβotherwise

    公式(4):PPO-style importance ratio 与 group-normalized advantage

    r

    i

    ,

    t

    =

    π

    θ

    train

    (

    y

    i

    ,

    t

    x

    ,

    y

    i

    ,

    <

    t

    )

    π

    θ

    old

    train

    (

    y

    i

    ,

    t

    x

    ,

    y

    i

    ,

    <

    t

    )

    ,

    A

    ^

    i

    ,

    t

    =

    R

    i

    mean

    (

    R

    1

    ,

    ,

    R

    G

    )

    std

    (

    R

    1

    ,

    ,

    R

    G

    )

    r_{i,t}= \\frac{ \\pi_{\\theta}^{\\text{train}}(y_{i,t}\\mid x,y_{i,<t}) }{ \\pi_{\\theta_{\\text{old}}}^{\\text{train}}(y_{i,t}\\mid x,y_{i,<t}) }, \\quad \\hat{A}_{i,t}= \\frac{ R_i-\\operatorname{mean}(R_1,\\ldots,R_G) }{ \\operatorname{std}(R_1,\\ldots,R_G) }

    ri,t=πθoldtrain(yi,tx,yi,<t)πθtrain(yi,tx,yi,<t),A^i,t=std(R1,,RG)Rimean(R1,,RG)

    论文报告训练中使用

    β

    =

    2

    \\beta=2

    β=2

    ϵ

    low

    =

    0.2

    \\epsilon_{\\text{low}}=0.2

    ϵlow=0.2

    ϵ

    high

    =

    0.28

    \\epsilon_{\\text{high}}=0.28

    ϵhigh=0.28,group size 为 32,batch size 为 32。

    这里的重点不是公式本身,而是 RL 稳定性。GLM-5 在 DSA 架构上做大规模 RL 时发现,DSA indexer 的 top-k 检索结果会影响训练稳定性。如果使用非确定性 CUDA top-k,RL 几步后可能性能急剧下降并伴随 entropy collapse。作者因此使用更慢但确定性的 torch.topk,并默认冻结 indexer 参数。

    这件事很工程,但非常有价值。它说明 Agentic RL 不只是奖励函数设计,也包括底层算子确定性、推理引擎与训练引擎一致性、索引器行为可复现性。AI 工程不是玄学,很多能力差异最终来自这些枯燥的系统细节。

    Agentic RL:异步 rollout 与长期任务训练

    GLM-5 的 Agentic RL 目标是提升 coding agent 和 search agent 任务。朴素 synchronous RL 在长时程 agent rollout 中会严重浪费 GPU,因为某些 trajectory 很长,导致同步点等待最慢样本。GLM-5 因此构建 fully asynchronous and decoupled RL framework,用 central Multi-Task Rollout Orchestrator 解耦 inference 和 training engines。

    为控制异步 off-policy 的训练稳定性,论文提出两个机制:

  • Token-in-Token-out gateway:保留 action-level exact correspondence,避免 re-tokenization mismatch。
  • Direct Double-sided Importance Sampling:对 rollout log-probabilities 做 token-level clipping,在不追踪历史 policy checkpoints 的情况下控制 off-policy bias。
  • 公式(5):异步 Agent RL 的 token-level clipping objective

    L

    (

    θ

    )

    =

    E

    t

    [

    f

    (

    r

    t

    (

    θ

    )

    ,

    ϵ

    l

    ,

    ϵ

    h

    )

    A

    ^

    t

    log

    π

    θ

    (

    a

    t

    s

    t

    )

    ]

    L(\\theta)= \\mathbb{E}_t \\left[ f(r_t(\\theta),\\epsilon_l,\\epsilon_h) \\hat{A}_t \\log\\pi_{\\theta}(a_t\\mid s_t) \\right]

    L(θ)=Et[f(rt(θ),ϵl,ϵh)A^tlogπθ(atst)]

    公式(6):rollout policy 与当前 policy 的 importance ratio

    r

    t

    (

    θ

    )

    =

    exp

    (

    log

    π

    θ

    (

    a

    t

    s

    t

    )

    log

    π

    rollout

    (

    a

    t

    s

    t

    )

    )

    r_t(\\theta)= \\exp\\left( \\log\\pi_{\\theta}(a_t\\mid s_t) -\\log\\pi_{\\text{rollout}}(a_t\\mid s_t) \\right)

    rt(θ)=exp(logπθ(atst)logπrollout(atst))

    公式(7):双侧截断函数

    f

    (

    x

    ;

    ϵ

    ,

    ϵ

    h

    )

    =

    {

    x

    ,

    if 

    1

    ϵ

    <

    x

    <

    1

    +

    ϵ

    h

    0

    ,

    otherwise

    f(x;\\epsilon_{\\ell},\\epsilon_h)= \\begin{cases} x, & \\text{if } 1-\\epsilon_{\\ell}<x<1+\\epsilon_h \\\\ 0, & \\text{otherwise} \\end{cases}

    f(x;ϵ,ϵh)={x,0,if 1ϵ<x<1+ϵhotherwise

    此外,论文还记录 rollout 使用的 policy weight version,丢弃过时样本;对 coding-agent sandbox 的环境崩溃做 failure reason 记录,避免把环境问题误当成模型能力问题。

    Rocky认为,这些机制是 Agentic Engineering 的真正门槛。做一个 coding demo 很容易,训练一个能在 10K+ SWE environments、terminal tasks、高难度多跳搜索任务中稳定学习的 agent,就需要完整工程基础设施。

    Search Agent:上下文管理决定长时程性能

    GLM-5 在 BrowseComp 上讨论了 context management。作者发现长上下文超过 100K token 后,模型准确率会显著下降,因此采用 Keep-recent-k 策略:当交互历史超过阈值

    k

    k

    k,只折叠早于最近

    k

    k

    k 轮的工具观察。实验中

    k

    =

    5

    k=5

    k=5,GLM-5 从 55.3% 提升到 62.0%。

    进一步,作者把 keep-recent 与 discard-all 组合成 Hierarchical Context Management:当总上下文超过阈值

    T

    =

    32

    k

    T=32k

    T=32k,丢弃整个 tool-call history 并用新上下文继续。

    在这里插入图片描述

    图 8 展示了不同 compute budgets 下的 BrowseComp 表现。结论是,keep-recent + discard-all 的层级策略达到 75.9,优于只用 discard-all。这里的启发很直接:长上下文不是越塞越多越好,Agent 需要上下文治理。记忆、折叠、遗忘和重启,都会成为 agent 系统设计的一部分。

    Slide Generation:奖励设计不是打分,而是防止模型钻空子

    论文还用 slide generation 展示 GLM-5 如何把 agentic training 扩展到内容生成工作流。模型在 HTML slide 生成中使用三级 reward:

  • Level-1:静态 markup attributes,例如位置、间距、颜色、字体、饱和度。
  • Level-2:runtime rendering properties,例如 DOM 宽高、bounding box、几何布局。
  • Level-3:visual perceptual features,例如异常留白、整体构图平衡。
  • 在这里插入图片描述

    图 9 展示了 reward hacking:模型可能通过硬截断、操纵 spacing 等方式骗过几何指标。作者通过 grounded runtime rendering 获取属性值,修复可被利用的漏洞,使奖励更接近真实审美目标。

    这部分很有现实意义。很多 AI 产品团队以为“给模型一个 reward”就能优化产品体验,但真实情况是,模型会学会 exploit reward。越接近产品闭环,reward design 越像安全工程和测试工程。

    适配中国芯片:模型能力必须落到部署现实里

    GLM-5 还专门讨论了中国 GPU/NPU 生态适配。论文称团队在华为昇腾、摩尔线程、海光、寒武纪、昆仑芯、沐曦、燧原七类国产芯片平台上做了 full-stack adaptation,并以 Ascend Atlas 系列为例讨论 W4A8 mixed-precision quantization、fusion kernels、vLLM-Ascend/SGLang 优化。

    这里最关键的是 W4A8:Attention 和 MLP blocks 用 W8A8,MoE experts 压到 W4A8,以便将 750B 参数 GLM-5 部署到单台 Atlas 800T A3。推理上则通过 Lightning Indexer、Sparse Flash Attention、MLAPO、D2H sampling overlap、RadixCache、Prefix Cache、DP+EP 混合并行、FlashComm、MTP 等手段提高长序列性能。

    Rocky认为,这一节的产业意义很强。国产大模型如果只在论文里强,不能在国产硬件上跑得稳、跑得便宜、跑得长,就很难成为产业基础设施。模型能力的终点不是 benchmark,而是可部署性。

    实验与证据:结果能支撑到什么程度

    ARC 基准:GLM-5 的强项在 Agentic 与 Coding

    论文最核心的评测是 ARC benchmarks,覆盖 reasoning/general、coding、agentic 三类任务。

    表 7:GLM-5 与开源/闭源前沿模型比较

    BenchmarkGLM-5GLM-4.7DeepSeek-V3.2Kimi K2.5Claude Opus 4.5Gemini 3 ProGPT-5.2 xhigh
    HLE 30.5 24.8 25.1 31.5 28.4 37.2 35.4
    HLE w/ Tools 50.4 42.8 40.8 51.8 43.4* 45.8* 45.5*
    AIME 2026 I 92.7 92.9 92.7 92.5 93.3 90.6 N/A
    HMMT Feb. 2025 97.9 97.1 92.5 95.4 92.9 97.3 99.4
    HMMT Nov. 2025 96.9 93.5 90.2 91.1 91.7 93.0 97.1
    IMO-AnswerBench 82.5 82.0 78.3 81.8 78.5 83.3 86.3
    GPQA-Diamond 86.0 85.7 82.4 87.6 87.0 91.9 92.4
    LongBench v2 64.5 59.1 59.8 61.0 64.4 68.2 59.8
    SWE-bench Verified 77.8 73.8 73.1 76.8 80.9 76.2 80.0
    SWE-bench Multilingual 73.3 66.7 70.2 73.0 77.5 65.0 72.0
    Terminal-Bench 2.0 Terminus-2 56.2 / 60.7† 41.0 39.3 50.8 59.3 54.2 54.0
    Terminal-Bench 2.0 Claude Code 56.2 / 61.1† 32.8 46.4 N/A 57.9 N/A N/A
    CyberGym 43.2 23.5 17.3 41.3 50.6 39.9 N/A
    BrowseComp 62.0 52.0 51.4 60.6 37.0 37.8 N/A
    BrowseComp w/ Context Manage 75.9 67.5 67.6 74.9 57.8 59.2 65.8
    BrowseComp-ZH 72.7 66.6 65.0 62.3 62.4 66.8 76.1

    τ

    2

    \\tau^2

    τ2-Bench

    89.7 87.4 85.3 80.2 91.6 90.7 85.5
    MCP-Atlas Public Set 67.8 52.0 62.2 63.8 65.2 66.6 68.0
    Tool-Decathlon 39.2 23.8 35.2 27.8 43.5 36.4 46.3
    Vending-Bench 2 $4,432 $2,377 $1,034 $1,198 $4,967 $5,478 $3,591
    GDPval-AA Elo 1,409 1,198 1,195 1,288 1,400 1,201 1,462

    这张表能支撑三个判断。

    第一,GLM-5 相比 GLM-4.7 有明显跃迁,尤其在 HLE w/ Tools、Terminal-Bench、BrowseComp、MCP-Atlas、GDPval-AA 等 agentic 指标上。

    第二,GLM-5 在开源/open-weight 模型中非常强,尤其 coding/agentic 方向已经接近闭源前沿系统。

    第三,它并不是全项领先。GPT-5.2、Gemini 3 Pro、Claude Opus 4.5 在部分 reasoning、SWE、Vending、Tool-Decathlon 上仍然领先。更准确的结论是:GLM-5 进入了前沿工程 agent 能力带,但还没有在所有真实工程闭环中压倒闭源模型。

    CC-Bench-V2:从 benchmark 到真实工程体验

    论文最值得展开的是 CC-Bench-V2。它不是只看模型能否解一道题,而是评估模型在前端、后端、长时程任务里的 end-to-end engineering experience。

    在这里插入图片描述

    图 10 展示 Agent-as-a-Judge 的评测管线。前端项目先 build,通过静态正确性检查后,再由 autonomous Judge Agent 使用 Playwright 和 bash 工具模拟用户交互,根据 checklist 判断功能是否满足。

    论文还做了可靠性验证:抽样 130 个 check-items,让人类专家与 Agent-as-a-Judge 独立打分,二者 point-wise 一致率为 94%;对 8 个前沿模型的 ranking consistency,自动框架与人类专家排名 Spearman correlation 为 85.7%。这说明 Agent-as-a-Judge 不是完美裁判,但已经具备一定可用性。

    表 8:CC-Bench-V2 前端、后端、长时程任务结果

    CategoryTaskMetricGLM-5GLM-4.7Claude Opus 4.5
    Frontend HTML ISR 38.9 35.4 52.2
    Frontend HTML CSR 76.3 64.9 82.2
    Frontend React ISR 34.6 17.2 39.7
    Frontend React CSR 71.0 49.4 70.7
    Frontend Vue ISR 32.7 24.5 46.9
    Frontend Vue CSR 77.1 53.8 74.3
    Build React BSR 100 65.0 95.0
    Build Vue BSR 100 70.0 100
    Build Svelte BSR 100 60.0 90.0
    Build Next.js BSR 95.0 70.0 80.0
    Backend Engineering Pass@1 25.8 19.6 26.9
    Long-horizon Repo Exploration Pass@1 65.6 47.8 64.5
    Long-horizon Chained Tasks Pass@1 52.3 43.0 61.6

    这张表很有意思,因为它同时展示了进步和边界。

    GLM-5 的 Build Success Rate 很强,React/Vue/Svelte 都到 100 或接近 100,说明生成可构建项目的基础工程能力很扎实。CSR 在 React/Vue 上甚至接近或超过 Claude Opus 4.5,说明许多细粒度需求可以完成。但 ISR 仍低于 Claude Opus 4.5,说明完整任务“一次全过”的能力还有差距。

    这正是 Agentic Engineering 的现实状态:模型能满足很多单项需求,但完整交付要求所有需求同时正确、没有回归、没有隐藏失败。工程不是单点成功率,而是系统成功率。

    长时程任务也类似。GLM-5 在 Repo Exploration 上达到 65.6,超过 Claude Opus 4.5 的 64.5,说明它在大仓库语义搜索和文件定位上很强;但 Chained Tasks 为 52.3,低于 Claude Opus 4.5 的 61.6,说明多步骤状态递归、错误累积和上下文一致性仍是难点。

    SWE-rebench:静态 benchmark 之外的时间鲁棒性

    SWE-bench Verified 已经公开多年,存在污染和过拟合风险。论文因此报告 SWE-rebench,它持续挖掘新的真实 GitHub issue-fixing tasks,用于衡量模型对新软件工程问题的泛化。

    表 9:SWE-rebench 2026 年 1 月结果

    ModelResolved RateSEMPass@5
    Claude Opus 4.6 52.9% 1.06% 70.8%
    GPT-5.2 xhigh 51.7% 1.21% 58.3%
    Claude Sonnet 4.5 47.1% 1.69% 60.4%
    Gemini 3 Pro 46.7% 2.04% 58.3%
    Claude Opus 4.5 43.8% 0.93% 58.3%
    GLM-5 42.1% 1.21% 50.0%
    GLM-4.7 41.3% 2.12% 56.3%
    Kimi K2.5 37.9% 1.21% 50.0%

    这张表比宣传图更冷静。GLM-5 在 SWE-rebench 上超过 GLM-4.7 和 Kimi K2.5,但低于 Claude Opus 4.5/4.6、GPT-5.2、Gemini 3 Pro。说明在新鲜真实 issue 修复上,GLM-5 已经进入可竞争区间,但还没有完全追平最强闭源 coding agent。

    Rocky认为,这样的结果反而让论文更可信。真正工程任务很难,模型报告如果处处碾压,反而需要警惕。GLM-5 的强项是 open-weight 阵营的工程能力跃迁,而不是宣称全面无敌。

    真实通用能力:不要让 Agent 能力牺牲用户体验

    在这里插入图片描述

    图 11 展示 GLM-5 在机器翻译、多语言对话、指令遵循、世界知识、工具调用等五类真实通用能力上相比 GLM-4.7 的提升。论文强调,这些能力来自高频用户交互模式,不只是狭义 benchmark。

    这部分的意义是防止模型为了 coding/agent 能力变得“偏科”。一个真正可用的 Agent 基座,不能只会执行工程任务,还要能和用户沟通、理解约束、遵守格式、调用工具、处理多语言。Agentic Engineering 的产品形态最终还是面向人,而不是只面对测试集。

    这篇工作的边界与可复现性

    GLM-5 的技术报告信息量很大,也给出了不少具体训练和评测细节,但仍然有几个边界需要明确。

    第一,很多关键数据和环境是内部构建的。比如 CC-Bench-V2、真实通用能力评测、部分 agentic environments、human-authored response anchors、中文芯片适配细节,都无法由外部团队完整复现。论文能说明方法和方向,但不能让社区完全复刻训练过程。

    第二,横向比较混合了不同来源与不同协议。ARC 表格中有官方报告、公开记录、内部复评,也有特定 agent framework 和特定 prompt 设置。尤其 Terminal-Bench、MCP-Atlas、BrowseComp 这类 agentic benchmark,对工具、超时、judge prompt、context management 很敏感,分数不能被简单视作绝对公平排名。

    第三,Agent-as-a-Judge 虽然有 94% point-wise consistency 和 85.7% ranking correlation,但它仍然是模型裁判,可能继承 judge model 的偏好和盲区。它适合规模化评测,不等于替代所有人工验收。

    第四,Agentic Engineering 的长时程能力仍有明显边界。CC-Bench-V2 的 Chained Tasks 与 SWE-rebench 都显示,GLM-5 在多步状态递归、长期一致性、完整任务成功率上仍落后最强闭源系统。Vibe Coding 到 Agentic Engineering 的路还没有走完。

    第五,论文的“open weights leader”与“open-source”表述需要谨慎区分。模型权重开放、代码开放、训练数据开放、训练基础设施开放是不同层级的开放。对产业采用来说,权重开放已经有价值,但对科学复现来说还不够。

    第六,国产芯片适配是重大工程成果,但论文中很多性能比较仍然是总结性描述。真实部署时,还需要看不同 batch size、context length、并发、成本、稳定性、生态工具链和线上 SLO。

    如果继续研究/落地,应该关注什么

    1. Agentic Engineering 的核心不是代码生成,而是闭环执行

    对开发者和产品团队来说,GLM-5 最值得学习的不是某个榜单分数,而是评测定义。CC-Bench-V2、Agent-as-a-Judge、SWE-rebench、Chained Tasks 都在逼近一个事实:真实软件工程不是生成代码,而是闭环执行。

    未来 AI Coding 产品要从“生成得像”转向“交付得稳”。这要求系统拥有:

  • 代码库检索能力。
  • 工具调用与环境执行能力。
  • 单元测试与 UI 验证能力。
  • 错误定位与自修复能力。
  • 多步任务状态管理能力。
  • 回归风险控制能力。
  • 缺任何一环,都只是更高级的代码生成器。

    2. 长上下文不是万金油,context management 会成为产品能力

    GLM-5 在 BrowseComp 中显示,简单堆长上下文不够。超过 100K token 后准确率可能下降,需要 keep-recent、discard-all、hierarchical context management 等策略。

    这对所有 Agent 产品都有启发。未来不是谁有最长上下文谁赢,而是谁能决定什么该记住、什么该折叠、什么该删除、什么时候重启上下文。记忆管理会成为 Agent 产品的核心能力。

    3. 异步 RL 是 Agent 训练的基础设施门槛

    长时程 agent rollout 不适合同步训练。轨迹长度差异大、工具调用慢、环境不稳定、reward 稀疏,都会导致 GPU idle 和训练噪声。GLM-5 用异步解耦、TITO、importance clipping、version filtering、sandbox failure filtering 来解决这些问题。

    Rocky认为,Agent 时代的 RL 竞争会越来越基础设施化。不是每个团队都能训练 agent,不是因为不会写 reward,而是因为没有足够可验证环境、没有稳定 rollout 系统、没有足够工程能力处理长尾失败。

    4. 评测会从“模型答题”转向“系统验收”

    GLM-5 报告里最先进的评测思想,是把测试变成系统验收。前端用 Playwright 交互,后端用真实 unit tests,长时程用 PR chain,搜索用 context management,商业任务用 Vending-Bench,工具用 MCP-Atlas。

    这会改变 AI 产品开发方式。未来 AI Agent 团队最重要的资产,可能不是 prompt 库,而是 evaluation harness。谁能定义真实任务、自动运行、自动验收、持续回归,谁就能迭代出更可靠的 Agent。

    5. 国产大模型的竞争会进入“模型 + 硬件 + 工具链”全栈阶段

    GLM-5 对七类中国芯片做 full-stack adaptation,这件事不能只看成部署细节。它意味着国产 AI 基础设施进入深水区:模型架构、稀疏注意力、量化、kernel、推理引擎、KV cache、并行通信都要协同优化。

    一级市场和产业落地要看清楚:未来不是只有模型公司,也不是只有芯片公司,而是模型和硬件之间的 co-design 能力会越来越重要。单点技术先进性不等于商业确定性,全栈适配能力才更接近长期壁垒。

    术语与概念速查

    概念含义在本文中的作用
    Vibe Coding 用自然语言和感觉驱动代码/应用生成 GLM-5 要跨越的上一阶段范式
    Agentic Engineering 模型在真实工程环境中规划、执行、验证、迭代 GLM-5 的核心目标
    ARC Agentic、Reasoning、Coding GLM 系列强调的三类关键能力
    MoE Mixture-of-Experts GLM-5 以 744B 总参数、40B 激活参数扩展容量
    MLA Multi-latent Attention 通过 latent KV 减少 KV cache 成本
    Muon Split 对不同 attention head 的 projection 分开做正交化 缓解 MLA 训练表现不足
    MTP Multi-token Prediction 提高 speculative decoding 接受长度
    DSA DeepSeek Sparse Attention 动态稀疏注意力,降低长上下文成本
    Reasoning RL 面向数学、科学、代码、工具集成推理的 RL 强化可验证推理能力
    Agentic RL 面向 coding/search agent 的长时程 RL 训练模型在环境中执行任务
    TITO Token-in-Token-out gateway 避免异步 RL 中 re-tokenization mismatch
    Direct Double-sided Importance Sampling 异步 off-policy 下的 token-level clipping 控制 rollout log-probability 偏差
    On-Policy Cross-Stage Distillation 跨阶段教师模型蒸馏 减少多阶段 RL 后的能力回退
    CC-Bench-V2 内部真实工程评测套件 覆盖前端、后端、长时程任务
    Agent-as-a-Judge 用自主 Judge Agent 交互验收前端任务 规模化自动评测 UI 正确性
    SWE-rebench 持续挖掘新 GitHub issue 修复任务的评测 衡量时间鲁棒、去污染的软件工程泛化

    拓展思考:值得继续扩展研究与思考的创新点

    1. 从 Vibe Coding 到 Agentic Engineering,是 AI Coding 的第二曲线

    Vibe Coding 让软件生产变得更轻,但它的天然上限是“生成”。Agentic Engineering 的目标是“交付”。两者之间不是词汇升级,而是生产关系变化。

    一个只会生成代码的模型,需要人类开发者承担工程闭环;一个能做 Agentic Engineering 的系统,则开始承担部分工程责任。前者是工具,后者接近工作流基础设施。

    2. 未来 AI 开发者的核心能力,是定义任务和验收标准

    GLM-5 报告反复出现 verifiable environments、unit tests、Agent-as-a-Judge、checklists、reward functions、sandbox failures。这说明模型训练和产品迭代越来越依赖“可验证任务”。

    AI 不会尊重一个人熬了多少年,只会放大一个人真正能创造多少价值。未来开发者的价值,会越来越多体现在能否把模糊需求拆成可执行、可验证、可回归的任务。

    3. Agent 产品的护城河,不是模型调用,而是环境闭环

    很多 Agent 创业项目会被基础模型吸收,原因是只做了一层模型封装,没有真实环境、真实数据、真实验收和持续反馈。GLM-5 这类报告提醒我们:真正的护城河在闭环。

    如果一个团队掌握高质量工程任务、可执行环境、自动测试、用户反馈、失败归因和持续训练链路,它就有机会形成模型之外的系统壁垒。

    4. 长时程一致性会成为下一代 Agent 的关键难题

    GLM-5 在 Chained Tasks 上仍落后 Claude Opus 4.5,说明长时程一致性还没解决。这个问题本质上不是“多给点上下文”这么简单,而是任务状态、决策历史、代码变更、测试反馈和未来步骤之间的因果关系维护。

    下一阶段 Agent 研究可能会更关注:

  • 任务记忆结构。
  • 可回滚编辑。
  • 计划与执行分层。
  • 自动 checkpoint。
  • 失败归因。
  • 长链路 self-correction。
  • 这些都比单轮 code generation 更接近真实软件工程。

    5. Rocky 的最终判断:工具红利会退潮,工程闭环会沉淀

    GLM-5 这篇报告给 Rocky 最大的启发是:AI Coding 已经从“让不会写代码的人也能写代码”进入“让复杂工程任务被重新组织”的阶段。

    工具会迭代,模型会换代,工作流会被重构。单点 prompt 技巧、单个 IDE 插件、单次生成体验,都会很快被更强模型吸收。真正能跨周期留下来的,是对任务、工程、产品、评测、基础设施和商业闭环的理解。

    GLM-5 的本质,不是一个更会写代码的大模型,而是一个把 AI Coding 推向工程化执行闭环的信号。

    这也是为什么它值得被认真阅读。

    推荐阅读

    Rocky一直在运营技术交流群(WeThinkIn-技术交流群),这个群的初心主要聚焦于技术话题的讨论与学习,包括但不限于算法,开发,竞赛,科研以及工作求职等。群里有很多人工智能行业的大牛,欢迎大家入群一起学习交流~(请添加小助手微信Jarvis8866,拉你进群~)

    1. 深入浅出完整解析AI Agent(AI智能体)的核心基础知识

    2025年可以说是AI Agent全面落地应用的元年,因此Rocky在持续撰写对AI Agent的全维度解析文章:深入浅出完整解析AI Agent(AI智能体)的核心基础知识

    2. 深入浅出完整解析扩散模型DDPM、DDIM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识

    和Rocky一起学习探究扩散模型的本质原理与和核心基础知识,同时不断跟进扩散模型的最新发展。Rocky在本文中对扩散模型的本质做了全面系统的梳理与讲解:深入浅出完整解析扩散模型DDPM、DDIM、SDE、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识

    3. 深入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识

    https://zhuanlan.zhihu.com/p/1975174691049189562

    4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识

    深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识

    5. 深入浅出完整解析DeepSeek系列核心基础知识

    深入浅出完整解析DeepSeek系列核心基础知识

    6、Sora等AI视频大模型的核心原理,核心基础知识,网络结构,经典应用场景,从0到1搭建使用AI视频大模型,从0到1训练自己的AI视频大模型,AI视频大模型性能测评,AI视频领域未来发展等全维度解析文章正式发布!

    码字不易,欢迎大家多多点赞:

    Sora等AI视频大模型文章地址:深入浅出完整解析Sora、Wan2.1、AnimateDiff、CogVideoX等AI视频大模型核心基础知识

    7、Stable Diffusion 3和FLUX.1核心原理,核心基础知识,网络结构,从0到1搭建使用Stable Diffusion 3和FLUX.1进行AI绘画,从0到1上手使用Stable Diffusion 3和FLUX.1训练自己的AI绘画模型,Stable Diffusion 3和FLUX.1性能优化等全维度解析文章正式发布!

    码字不易,欢迎大家多多点赞:

    Stable Diffusion 3和FLUX.1文章地址:深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识

    8、Stable Diffusion XL核心基础知识,网络结构,从0到1搭建使用Stable Diffusion XL进行AI绘画,从0到1上手使用Stable Diffusion XL训练自己的AI绘画模型,AI绘画领域的未来发展等全维度解析文章正式发布!

    码字不易,欢迎大家多多点赞:

    Stable Diffusion XL文章地址:深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识

    9、Stable Diffusion 1.x-2.x核心原理,核心基础知识,网络结构,经典应用场景,从0到1搭建使用Stable Diffusion进行AI绘画,从0到1上手使用Stable Diffusion训练自己的AI绘画模型,Stable Diffusion性能优化等全维度解析文章正式发布!

    码字不易,欢迎大家多多点赞:

    Stable Diffusion文章地址:深入浅出完整解析Stable Diffusion(SD)核心基础知识

    10、ControlNet核心基础知识,核心网络结构,从0到1使用ControlNet进行AI绘画,从0到1训练自己的ControlNet模型,从0到1上手构建ControlNet商业变现应用等全维度解析文章正式发布!

    码字不易,欢迎大家多多点赞:

    ControlNet文章地址:深入浅出完整解析ControlNet核心基础知识

    11、LoRA系列模型核心原理,核心基础知识,从0到1使用LoRA模型进行AI绘画,从0到1上手训练自己的LoRA模型,LoRA变体模型介绍,优质LoRA推荐等全维度解析文章正式发布!

    码字不易,欢迎大家多多点赞:

    LoRA文章地址:深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识

    12、深入浅出完整解析AIGC时代Transformer核心基础知识

    在AIGC时代中,Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向,成为AI技术架构大一统与多模态整合的关键核心基座,大有一统“AI江湖”之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析:

    Transformer文章地址:深入浅出完整解析AIGC时代Transformer核心基础知识

    13、最全面的AIGC面经《手把手教你成为AIGC算法工程师,斩获AIGC算法offer!(2024年版)》文章正式发布!

    码字不易,欢迎大家多多点赞:

    AIGC面经文章地址:手把手教你成为AIGC算法工程师,斩获AIGC算法offer!

    14、50万字大汇总《“三年面试五年模拟”之算法工程师的求职面试“独孤九剑”秘籍》文章正式发布!

    码字不易,欢迎大家多多点赞:

    算法工程师三年面试五年模拟文章地址:https://zhuanlan.zhihu.com/p/545374303

    《三年面试五年模拟》github项目地址(希望大家能多多star):https://github.com/WeThinkIn/Interview-for-Algorithm-Engineer

    15、Stable Diffusion WebUI、ComfyUI、Fooocus三大主流AI绘画框架核心知识,从0到1搭建AI绘画框架,从0到1使用AI绘画框架的保姆级教程,深入浅出介绍AI绘画框架的各模块功能,深入浅出介绍AI绘画框架的高阶用法等全维度解析文章正式发布!

    码字不易,欢迎大家多多点赞:

    AI绘画框架文章地址:深入浅出完整解析主流AI绘画框架(ComfyUI、Stable Diffusion WebUI、Fooocus)核心基础知识

    16、GAN网络核心基础知识,网络架构,GAN经典变体模型,经典应用场景,GAN在AIGC时代的商业应用等全维度解析文章正式发布!

    码字不易,欢迎大家多多点赞:

    GAN网络文章地址:https://zhuanlan.zhihu.com/p/663157306

    17. AI算法工程师的《三年面试五年模拟》求职秘籍

    AIGC时代的算法工程师的求职面试秘籍(持续更新中)

    18. AIGC产业的深度思考与分析

    2023年3月21日,微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示,自从1980年首次看到图形用户界面(graphical user interface)以来,以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。

    Rocky也认为,AIGC及其生态,会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期,未来随着AIGC的全面落地和深度商用,会深刻改变我们的工作、生活、学习以及交流方式,各行各业都将被重新定义,过程会非常有趣。

    那么,在此基础上,我们该如何更好的审视AIGC的未来?我们该如何更好地拥抱AIGC引领的革新?Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点,希望能帮助各位读者对AIGC有一个全面的了解:

    深入浅出全面解析AIGC时代核心价值与发展趋势(2025年版)

    赞(0)
    未经允许不得转载:171主机测评 » 一文读懂GLM-5:从 Vibe Coding 到 Agentic Engineering核心基础知识
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址