GLM-5.3 发布:同一底座,靠后训练把编程 Agent 再推一步

智谱于 2026 年 8 月 14 日发布 GLM-5.3。新模型沿用 GLM-5.2 的底座,把训练增量集中在后训练和长程任务环境上,编程、终端操作与网络安全能力明显提升;Coding Plan 已全量开放,模型权重计划两周内公开。

GLM-5.3 后训练环境汇聚至智能核心的蓝紫色科技插画
GLM-5.3 智谱 AI 编程模型 AI Agent 开源模型

智谱在 2026 年 8 月 14 日发布 GLM-5.3。它没有更换 GLM-5.2 的基础模型,也没有把参数规模继续往上堆,主要变化来自更大规模的后训练:更多可执行环境、更丰富的长程任务,以及投入这些任务的更多训练算力。

这条路线让 GLM-5.3 成为一次很有辨识度的版本更新。智谱称,新模型在内部 Z.ai Code Bench 上较 GLM-5.2 提升 50%,公开评测中的终端操作、软件工程和通用 Agent 任务也普遍进步。对开发者来说,最值得观察的不是某个榜单名次,而是同一底座在真实工程环境里还能被后训练推多远。

GLM-5.3 没换底座,训练重点换成了真实工作环境

GLM-5.3 与 GLM-5.2 使用相同的基础模型。智谱过去一个月沿用已有技术栈,继续扩大后训练规模,其中包括用于长上下文处理的 IndexShare、面向长程任务强化学习的 SAO,以及开源异步训练框架 slime。

更关键的变化发生在任务环境。新一轮训练不只让模型解决短小的代码题,而是把它放入接近真实工作的环境:代码库、内部文档、计算集群、存储系统和实验结果都可能成为任务的一部分。有些任务按官方描述需要有经验的工程师工作数天,模型必须诊断问题、修改实现、运行实验,再根据结果继续迭代。

这种设计更贴近编程 Agent 的实际瓶颈。模型能写出一段正确代码,只能说明它具备局部能力;能否在数百轮工具调用中维持目标、处理失败并完成交付,才决定它能不能进入日常研发流程。

编程与 Agent 评测出现了哪些变化

官方公布的多项结果显示,GLM-5.3 相比前代的增益主要集中在长程执行和复杂工程任务。

评测

GLM-5.2

GLM-5.3

观察重点

Terminal-Bench 3.0

4.6

28.3

终端环境中的多步骤任务提升最明显

DeepSWE v1.1

46.2

66.9

软件工程任务完成能力上升

Agents' Last Exam

23.8

28.5

通用 Agent 能力稳步改善

AutomationBench v1.0.6

26.2

48.2

跨应用自动化工作流进步

这些成绩来自特定 Harness、上下文长度、推理档位和超时设置,不能直接等同于所有用户场景。尤其是智谱自研的 Z.ai Code Bench 属于私有评测,外部无法完整复现。不过,官方同时披露了任务完成率和输出 Token:在 High effort 档,GLM-5.3 以约 5 万输出 Token 获得 31.4% 的完成率;在 Max effort 档则以约 7.5 万输出 Token 达到 34.5%。这说明新版本的提升不只是依靠更长输出换来的。

二手实测也呈现出更具体的边界。GLM-5.3 可以持续调用工具、查看生成结果并反复修正,适合网页应用、交互原型和多文件工程任务;但在复杂 3D 场景中,视觉质量并不稳定,长时间运行也不保证结果一定优于更短的流程。接入 Claude Code 等第三方 Harness 时,自动命令审批还可能出现兼容问题。

网络安全能力成为意外增长点

智谱把漏洞发现环境加入了后训练,并发现这类能力随训练规模增长得比预期更快。GLM-5.3 在 CyberGym 上得到 84.5%,高于 GLM-5.2 的 77.2%;在要求更深漏洞利用推理的 ExploitBench 上,从 24.4% 提升到 54.4%。不过在后者中,它仍落后于官方列出的头部闭源模型。

官方还披露,在人工审查、筛选和去重后,GLM 系列模型在 269 个项目中识别出 2436 个漏洞,其中 1097 个属于中高危问题。这个结果覆盖系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用和网络协议。

这部分能力需要谨慎理解。安全评测中的进步说明模型更善于跨文件追踪缺陷、构造验证路径,也可能反哺代码审查和修复工作;它不等于普通团队可以把生产系统直接交给模型自主攻防。权限隔离、沙箱、命令审批和人工复核仍是必要条件。

现在能在哪里用,哪些信息还没落定

GLM-5.3 已向 GLM Coding Plan 用户全量开放,可用于 ZCode、Claude Code、OpenCode 等编程 Agent。新版 Coding Plan 改为积分额度:输入、缓存输入和输出 Token 分别计费;北京时间工作日 14:00—18:00 为高峰时段,其余时间及周末按标准积分的 50% 消耗。

模型支持 lowhighmax 三档思考强度,不再支持完全关闭思考。这个变化会影响延迟、Token 消耗和任务成本,迁移现有自动化流程时应重新测量,而不能直接沿用 GLM-5.2 的预算。

模型权重计划在发布后两周内公开。截至本文发布时,官方发布页尚未给出最终权重地址,API 的正式可用时间和具体价格也不宜根据前代价格推断。准备自部署或批量调用的团队,可以先等权重、许可证和计费文档同时落地,再估算基础设施与推理成本。

小团队最该先测的三类任务

GLM-5.3 的优势集中在长程任务,简单问答很难看出版本差异。已有 Coding Plan 的团队可以优先做三组对照测试:

  1. 真实仓库修复。 选择有测试套件、影响范围明确的中等难度 Issue,对比一次完成率、回归问题、工具调用次数和总 Token。
  2. 跨工具交付。 让模型完成“读需求—改代码—运行测试—查看页面—修正结果”的闭环,重点记录它在哪一步丢失上下文或需要人工接管。
  3. 受控安全审查。 只在隔离环境和已授权代码上测试依赖风险、输入校验与权限边界,保留执行日志,不开放生产凭据和高权限命令。
对独立开发者和小团队,GLM-5.3 更像一个值得纳入候选池的新执行引擎,而不是仅凭榜单就能直接替换现有模型的结论。

接下来真正影响选择的,是权重开放后的部署门槛、API 价格,以及第三方在统一 Harness 下的可复现实测。如果这些条件合适,同底座依靠后训练获得的大幅提升,会让 GLM-5.3 在代码 Agent 和长程自动化工作流中具备实际竞争力。