2026 年 8 月 14 日,智谱(Z.ai,港股 02513)正式发布新一代基座模型 GLM-5.3,官方口径是"智谱迄今最强的开源权重编程模型"。发布本身不算意外——智谱 7 月 ARR 已达 10 亿美元,是国内第一家迈过这个里程碑的大模型厂商,旗舰更新是常规动作。真正反常的是这代升级的"配方":743B 参数,和 GLM-5.2 是同一个基座,架构没动、参数没堆,几乎全部的能力提升都来自后训练缩放——用更长程的任务环境、更丰富的环境类型、更长的强化学习时间来"榨"出上限。本文要回答三个问题:它到底强在哪、与闭源旗舰的真实差距有多大、以及通过中转站怎么用、什么时候能用上。

Key Takeaways(先给你结论)

  • 743B 参数,与 GLM-5.2 同一基座——架构未变,提升全部来自后训练。
  • DeepSWE v1.1 66.9,开源模型第一;Terminal-Bench 3.0 4.6→28.3、SWE-Marathon 19.4→42.5。
  • CyberGym 84.5%,所有已评测模型中的第一——超过 Mythos 5(83.8%)与 GPT-5.6 Sol(83.6%)。
  • 网络安全能力太强反而"拖累"发布:权重与 API 因安全加固延后约两周,敏感网络能力分级为"trusted access"。

在展开之前,先给读者一张"本文地图":第二节讲 GLM-5.3 到底是什么(纯后训练、Slime 框架、Effort Level 机制);第三节把编程/Agent 跑分全景摆出来,并诚实标出它与闭源旗舰的差距;第四节拆解网络安全这个"双刃剑"——它既是 GLM-5.3 全场第一的亮点,也是它发布延后、能力分级、API 强制思考的根源;第五节回答"与闭源旗舰的真实差距有多大";第六节讲最实际的——通过中转站怎么用、什么时候能用上;最后是结论。如果你只想知道"现在能不能用",直接跳到第六节;如果你想判断"值不值得等",建议从头读。

照例先交代本文的事实纪律。GLM-5.3 侧的规格、跑分与发布信息,以智谱官方发布材料为准,并尽量与本站每日 AI 资讯的第三方转述(界面新闻等)交叉核对;闭源竞品 Fable 5、GPT-5.6 Sol、Mythos 5、Claude Opus 4.8 的对照数字,均取自智谱官方给出的对比口径,凡无第三方独立复测之处本文会明确标注。需要特别提醒的是:GLM-5.3 的 API 与可下载权重截至发稿(2026年8月15日)尚未上线,官方预告约两周后开放,因此本文写到的绝大多数跑分属于"厂商自报、待独立复测"——这与 DeepSeek、Grok 那类"发布即 API"的节奏不同,读跑分时请先把这个前提放在心里。

一、GLM-5.3 是什么:一次「纯后训练」的旗舰升级

先摆硬规格。GLM-5.3 总参数 743B,与 GLM-5.2 完全同一个基座——换句话说,智谱这代没有换底座、没有扩大参数规模。官方明确表示,所有能力提升都来自后训练缩放(post-training scaling):在更长程的任务环境里跑强化学习,用比前代多数十倍的长程任务样本、更丰富的环境类型和明显更长的后训练时间来提升能力上限。智谱自称"自测编码能力较 GLM-5.2 提升约 50%"。这与 DeepSeek V4 系列、Grok 4.6 这半年的打法完全一致——2026 年下半年的竞争重心,已经从"堆架构、堆参数"转向"把后训练调到极致"。GLM-5.3 只是这条趋势里最新、也最彻底的一个例子。

有两个工程细节值得单独说。第一个是训练框架:GLM-5.3 基于开源的 Slime 框架训练,官方称其端到端强化学习吞吐相对既有方案提升 2.3 倍,这直接让"用更长程、更大规模的 RL 数据做后训练"在成本上变得可行——没有这个吞吐优势,这次"纯后训练"的路线可能根本不成立。第二个是推理侧的 Effort Level 机制:模型提供四档推理深度(从 Non-Thinking 非思考,到 Low / High / Max 三档思考),让用户在"快而省"和"慢而强"之间按任务选择。这个机制本身不算新鲜(DeepSeek、Grok 都有类似档位),但 GLM-5.3 把它和"API 强制开启思考"绑在了一起,这一点在第五节会展开。

还有一个容易被忽略但很关键的工程含义:因为基座没变,GLM-5.2 时代沉淀下来的部署工具链、量化方案和推理基础设施,大部分可以平滑迁移到 5.3。对自托管中转站和自建集群来说,这意味着"换权重"的成本远低于"换模型",两代之间的升级更像 DeepSeek V4 Flash 那次"同参数重训练",而不是一次推倒重来。这一点在第五节接入部分还会再提。

关于 Effort Level 机制,有一个值得展开的实操细节:四档推理深度不是"四种模型",而是同一个模型在推理时分配多少思考预算。Non-Thinking 档适合高吞吐、低复杂度的批量任务,Max 档适合最难的编程/Agent 任务;档位越高,单次消耗的 token 和延迟越高,但复杂任务的成功率也越高。对开发者来说,合理用法是"按任务难度动态选档",而不是无脑拉满——这会直接影响你的账单。这也是为什么本节和第五节会反复提醒你注意成本估算,因为 GLM-5.3 的能力分布和成本分布是强相关的。

一句话总结这代产品:GLM-5.3 不是"新架构",而是一次把同一个底座的后训练潜力挖到极致的产物。它的意义不在于"新",而在于证明了一件事——开源阵营不需要靠更大的模型,也能通过后训练逼近闭源旗舰。这个判断对不对,要看跑分和独立复测,下面进入正题。

二、编程/Agent 跑分全景:开源第一,但先别急着对标闭源

官方公布的 GLM-5.2 → GLM-5.3 跑分变化如下(均为厂商自报,尚未有大规模第三方复测):

基准GLM-5.2GLM-5.3
Terminal-Bench 3.04.628.3
DeepSWE v1.146.266.9(开源第一)
Agents' Last Exam(CLI)23.828.5
SWE-Marathon19.442.5
FrontierSWE67.578.1
AutomationBench48.2
GDPVal-AA v2(Elo)1769
Toolathlon Verified73.0
HLE with Tools62.5–68.7
Z.ai Code Bench(@ Max)23.4%34.5%

这张表读起来最震撼的是两行。第一是 Terminal-Bench 3.0:4.6 → 28.3,涨了大约 6 倍——这说明 5.2 在真实终端任务上几乎是"不能打"的,而 5.3 把它拉到了可用水平。第二是 DeepSWE v1.1:46.2 → 66.9,居开源模型第一。DeepSWE 是当前编程 Agent 评测里最有分量的基准之一(真实 GitHub issue 修复),"开源第一"这个头衔直接对标的是 GLM-5.2 时代还被闭源压在下面的局面。SWE-Marathon 19.4→42.5、FrontierSWE 67.5→78.1 同样是大幅跳升。需要说明的是,AutomationBench 48.2、GDPVal-AA v2 1769、Toolathlon Verified 73.0、HLE with Tools 62.5–68.7 这几项官方没有给出 GLM-5.2 的对比基线,本文只如实转述 5.3 的单点成绩,不替官方补一个"提升幅度"出来。

把开源和闭源放到同一张表上,差距看得更清楚(以下闭源数字均为智谱官方给出的对比口径):

基准GLM-5.3Claude Fable 5GPT-5.6 Sol
Terminal-Bench 3.028.333.734.6
DeepSWE v1.166.969.7

这张小表的信息量其实很大:GLM-5.3 在 Terminal-Bench 3.0 上落后两个闭源旗舰约 5~6 个点,在 DeepSWE 上落后 Fable 5 不到 3 个点——差距是"能感知、但已经不大"的级别,而不是"断档"的级别。一年前开源模型在 DeepSWE 这类基准上落后闭源往往在 20 个点以上,现在被压缩到个位数。这就是"差距收窄"这句话的量化含义。

但这里必须给读者划一条诚实的线:"开源第一"不等于"全场第一"。拿官方给的最直接的闭源对照看——在 Terminal-Bench 3.0 上,GLM-5.3 的 28.3 仍落后于 Claude Fable 5 的 33.7 和 GPT-5.6 Sol 的 34.6;在 DeepSWE v1.1 上,GLM-5.3 的 66.9 也仍低于 Fable 5 的 69.7。换句话说,GLM-5.3 确实把开源模型的天花板抬高了,但闭源第一梯队(尤其是 Anthropic 系的 Fable 5)在头条编程基准上仍然领先。真正的悬念不是"5.3 是不是全场第一"——它还不是——而是"差距已经缩小到只剩几个点",这在一年前是不可想象的。

GLM-5.3 还有一个真正的差异化优势:token 效率。官方对比显示,它在 Z.ai Code Bench 上以约 5 万 token/任务 的消耗拿到 31.4%,超过了 Claude Opus 4.8 用约 12 万 token/任务 拿到的 29.5%——也就是说,同样的任务,GLM-5.3 花不到一半的 token 就做得更好。不过它仍落后于 Fable 5(@ Max 档 39.5%)。这个"少花 token"的优势对中转站用户尤其重要:如果按 token 计费,GLM-5.3 的成本/任务会比"看单次报价"更低。这一点在第五节算账时还要回来。

怎么理性看待这轮跑分

厂商自报跑分说明后训练确实在进步,但 GLM-5.3 的 API 和权重都还没上线,所有数字都缺少第三方复测。在 LMSYS Chatbot Arena 这类公开竞技场看到 GLM-5.3 之前,建议把"开源第一"当作"官方声称的开源第一",把"落后闭源几个点"当作"官方口径下的差距"——两套数字都值得记录,但都别急着当最终结论。

三、网络安全能力的双刃剑:最强,也最"麻烦"

如果说编程跑分是 GLM-5.3 的"正面战场",那网络安全能力就是它最特殊、也最容易被忽略的一面。官方公布的网络攻防基准成绩相当惊人:CyberGym 84.5%,在所有已评测模型中排名第一——超过了 Anthropic 的 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。这不是"开源第一",是"全场第一",是 GLM-5.3 唯一一个把所有闭源旗舰都压在身下的主要跑分。

其他安全侧数字同样夸张:ExploitBench 54.4%,比 GLM-5.2 的 24.4% 直接翻倍;ExploitGym 上 2 小时完成 105 个任务。更值得注意的是智谱官方披露的漏洞挖掘成果:在发布前的安全研究中共识别出 2,436 个开源项目漏洞,覆盖 269 个开源项目,其中 1,097 个为高危/严重;最早的一个漏洞可以追溯到 1981 年,平均"发现滞后"长达 26.6 年——也就是说,这个模型能在几分钟内找出人类安全社区十几年都没发现的老漏洞。这不是实验室里的花活,而是实打实的攻击能力。

能力越强,监管和产品化的代价就越大,这正是 GLM-5.3 发布节奏"反常"的原因。智谱官方明确表示,因为网络攻防能力太强,需要先做安全加固,所以可下载权重与 API 都比模型本身延后约两周(预计 8 月底左右);敏感的网络安全能力被分级为 "trusted access",只对经过审批的合格用户开放。对普通 API 用户来说,最直接的影响是:API 强制开启思考模式,你只能在 low / high / max 三档 effort 中选择,无法关闭思考。换言之,你想用它的强大能力,就得接受它更严的闸门和更高的单次成本——这就是"双刃剑"落到用户身上的样子。

对本站读者(国内开发者、中转站用户)来说,这一节的现实意义有三条:第一,安全分级意味着"能跑通 GLM-5.3 API"和"能拿到全部网络安全能力"是两回事,绝大多数中转站用户只会拿到常规能力,别期待通过中转站白嫖到完整的红队能力;第二,API 强制思考意味着你在做成本估算时,不能按"非思考档"的便宜价格来算——GLM-5.3 的实际单次调用成本会比"看起来"高;第三,权重延后两周意味着自托管中转站要跟进新权重,也需要等这两周。

从更宏观的视角看,GLM-5.3 其实是"能力越强、护栏越厚"这个行业规律的最新样本。OpenAI、Anthropic 过去一年在安全对齐上投入巨大,一部分原因正是模型攻击能力水涨船高;智谱这次把"网络攻防能力"单独拎出来做 trusted access 分级,说明国内头部大模型厂商也开始把"能力安全"当成产品发布的硬约束来对待。对开发者的启示是:以后挑模型不能只看跑分,还要看"能跑到什么程度、闸门怎么开"——同样的模型 ID,不同用户拿到的能力边界可能是不同的。这是 2026 年选型里一个容易被忽略、但会越来越重要的变量。

四、与闭源旗舰的真实差距:收窄了,但还没追平

把前两节合起来,就能得到对 GLM-5.3 最诚实的一句话评价:它在开源阵营里是第一,在所有模型里还不是第一;它和闭源第一梯队的差距已经从"代差"缩小到"几个点",但还没追平。具体到不同维度:

  • 头条编程基准:Terminal-Bench 3.0 落后 Fable 5(33.7)与 GPT-5.6 Sol(34.6)约 5~6 个点;DeepSWE v1.1 落后 Fable 5(69.7)约 3 个点。差距在收窄,但闭源仍领先。
  • 网络安全:CyberGym 84.5% 是所有已评测模型中的第一,这是 GLM-5.3 唯一"全面领先"的维度,也是它被安全审查盯上的原因。
  • token 效率:约 5 万 token/任务达到 Opus 4.8 约 12 万 token/任务的水平,性价比是实打实的差异化优势;但低于 Fable 5 @ Max 的 39.5%。
  • 价格:官方强调 API 定价约为美国前沿模型每 token 单价的十分之一。这与本站此前核实过的 GLM-5.2 旗舰定价(约 $1.4/$4.4 每百万 token)口径一致——相对 Fable 5 的 $10/$50,大约是 1/7~1/11,符合"约十分之一"的说法。注意这是厂商定位,具体 5.3 的最终价格要等 API 上线才能核实。

这里有一个值得单独说的判断:如果只看"开源第一 + 价格约闭源 1/10 + token 效率优势",GLM-5.3 的定位其实非常清晰——它不是来和 Fable 5 / GPT-5.6 Sol 抢"最强"的,而是来抢"最强开源 + 最强性价比"的。对预算敏感、或对数据/自托管有要求的场景,这个定位比"跑分第一"更值钱。但对"我就要当前地表最强编程模型"的用户,答案仍然不变:闭源第一梯队(尤其是 Fable 5)还在前面。

五、如何通过中转站接入 GLM-5.3

先说最要紧的现状,避免读者白跑一趟:截至 2026年8月15日,GLM-5.3 的 API 和可下载权重都还没有上线。官方预告约两周后(预计 8 月底)开放。当前能用到 GLM-5.3 的渠道只有智谱自家的三个产品:GLM Coding Plan 订阅、ZCode 编程工具、AutoClaw——它们从发布当日起就对全量用户开放。所以,"现在就想用上"的最快路径不是中转站,而是这三条官方产品线。

中转站读者真正关心的时机在这里:等 API + 权重上线后,接入逻辑和 GLM-5.2 以及其他 OpenAI 兼容模型完全一样,核心就两步——把 base_url 指向中转站的 OpenAI 兼容端点,把 model id 换成 GLM-5.3 对应的模型名。以 LiteLLM / OpenRouter 这类聚合层为例,将来大概会长这样(注意:具体模型 ID 以 API 上线后各家控制台实际列表为准,下面只是接入形态示例):

model_list:
  - model_name: glm-5.3
    litellm_params:
      model: openai/glm-5.3
      api_base: https://你的中转站域名/v1
      api_key: os.environ/RELAY_API_KEY

如果走 OpenAI 官方 SDK,将来只需要改 base_url 和 model 两处:

from openai import OpenAI
client = OpenAI(base_url="https://你的中转站域名/v1", api_key="中转站key")
resp = client.chat.completions.create(
    model="glm-5.3",
    messages=[{"role": "user", "content": "修复这个 bug"}],
)

与本站已评审厂商交叉核对的情况是:GLM 系列在国内中转生态里的覆盖率一直不低。智谱官方 API 条目(bigmodel.cn,国内直连)本站已收录并核验;而在已收录的中转站/聚合平台里,多家明确标注支持 GLM 系列模型,包括硅基流动(SiliconFlow)、OpenRouter、AIHubMix、CloseAI、4SAPI、诗云API、神马API 等。需要特别提醒两点:第一,"支持 GLM-5.2" 不等于 "已经更新到 GLM-5.3"——API 和权重都没上线,目前没有任何一家中转站能提供 GLM-5.3,本文也不建议你相信任何"现已可测"的渠道;第二,权重是开源的(官方承诺两周内开源),所以自托管型中转站会自行跟进新权重,具体以各家公告为准。选型时请以各中转站控制台实际列出的模型列表为最终依据。

最后给中转站用户一句成本提醒:因为 API 强制开启思考模式(low/high/max),你在做预算时请按"思考档"的定价来估算,而不是按非思考档。再叠加它 token 效率高的特点,GLM-5.3 的"每任务成本"很可能比单看每百万 token 报价更划算——但这是上线后才能验证的事,本文先把事实和机制讲清楚,具体账等 API 落地后再算。

把"什么时候能用上"再收拢一下,给读者一张时间表:现在(8月15日)——只能用智谱自家的 GLM Coding Plan / ZCode / AutoClaw 三条官方产品线,全量用户可测;约两周后(预计8月底)——API 上线、权重开源,第三方中转站与自托管集群开始跟进;之后 1~2 周——才是各路中转站陆续上架、模型 ID 与价格稳定下来的时间。前两周请重点盯官方公告,后两周再盯中转站控制台。如果你想抢在别人前面用上 API,最可靠的动作是先去智谱官方(bigmodel.cn / z.ai)登记开发者账号、把 GLM-5.2 的接入先跑通——5.3 上线时大概率是同一个 OpenAI 兼容接口,模型 ID 一换就能切过去。

六、结论:值得等吗?什么时候用得上?

把整篇拆解的结论收拢成三句话。

第一,GLM-5.3 值得等。它是目前官方口径下最强的开源编程模型,DeepSWE 66.9 开源第一、CyberGym 84.5% 全场第一、token 效率超过 Opus 4.8,而价格定位约为闭源旗舰的十分之一。如果你正在用 GLM-5.2、Qwen、DeepSeek 这类开源/国产模型做编程 Agent,GLM-5.3 几乎肯定是"下一站";唯一的不确定是那些跑分还缺第三方复测,落地前建议先小流量验证。

第二,什么时候用得上,分两条时间线。想立刻用——现在就走智谱自家的 GLM Coding Plan / ZCode / AutoClaw 三条官方产品线,它们从 8 月 14 日起就对全量用户开放。想通过 API 或中转站用——请等约两周(预计 8 月底),届时 API 上线、权重开源,中转站才会陆续跟进。在那之前,任何"中转站现已可测 GLM-5.3"的说法都值得怀疑。

第三,怎么先用上,也分两种人。预算敏感、想要开源可自托管、能接受"开源第一但不是全场第一"的开发者,直接等 API + 中转站接入,把它当编程主力模型;对"我就要地表最强"的用户,闭源第一梯队(Fable 5 / GPT-5.6 Sol)仍然在头条基准上领先,GLM-5.3 更适合做性价比补充而不是唯一选择。网络安全能力那部分是双刃剑——它给了 GLM-5.3 一个"全场第一",也给了它"trusted access 分级 + API 强制思考 + 权重延后两周"这三道闸门,普通用户拿到的是常规能力,按常规成本去规划就好。

最后说一个本文反复出现、但值得单独点名的核心判断:GLM-5.3 把"开源编程模型的天花板"和"性价比的地板"同时定义了一遍。在它之前,开源阵营拿得出手的编程模型(GLM-5.2、DeepSeek V4、Qwen3.8-Max)要么跑分差闭源一截,要么价格优势不够彻底;在它之后,"开源第一 + 价格约闭源 1/10 + 更高 token 效率"成了可以同时成立的组合。如果你所在的团队正卡在"闭源太贵、开源太弱"的中间地带,GLM-5.3 大概率就是你等的那个答案——等它 API 落地、第三方复测出炉,这个判断会更稳。

一句话结论

GLM-5.3 是"纯后训练"路线的里程碑:没换架构、没堆参数,却把开源编程能力抬到了 DeepSWE 66.9 开源第一、CyberGym 84.5% 全场第一的位置。它和闭源旗舰的差距已经缩小到几个点但还没追平;它真正的卖点是"开源第一 + 价格约闭源 1/10 + 更高的 token 效率"。想用——现在走 GLM Coding Plan / ZCode / AutoClaw;想接中转站——再等约两周,API 与权重上线后再验证各家模型 ID,别信任何"现已可测"的渠道。