2026年6月13日,智谱AI(Zhipu / Z.ai)悄悄放出GLM-5.2试用,官方甚至没有第一时间贴出跑分表。三天后模型权重以MIT协议完全开源,API定价随之公布——输入约$1.40/M tokens、输出$4.40/M tokens。接下来的两周里,这两个数字在Hacker News、Reddit、X(Twitter)上被反复引用:它在SWE-bench Pro等编程基准上超过了GPT-5.5,在Artificial Analysis的开源模型榜单上排名第一,在有数百万真实开发者投票的Code Arena编程竞技场上,全球所有可用模型里排名第二——仅次于Anthropic同期发布的旗舰Claude Fable 5。而它的价格,只有Fable 5的一个零头。

这篇文章想讲清楚四件事:

  • GLM-5.2到底是什么、什么时候发布的,为什么会突然引爆全网
  • 它相对Claude Fable 5——Anthropic目前定价最高、面向最难任务的旗舰模型——性价比具体赢在哪、赢多少
  • 为什么"性价比全面超过"和"GLM-5.2是更强的模型"是两件完全不同的事,本文只主张前者
  • 作为国内读者,如果你想用上GLM-5.2,中转渠道和直接注册相比价值在哪里

一、GLM-5.2 是什么:发布节奏与技术参数

智谱AI(Zhipu AI)成立于2019年,脱胎于清华大学计算机系自然语言处理实验室,国际品牌统一为 Z.ai。GLM-5.2 是 GLM-5 系列的迭代版本,前身是2026年4月8日发布的 GLM-5.1——当时 GLM-5.1 就已经打出"开源模型首次全面对齐 Claude Opus 4.6"的旗号,并用一个很有传播性的噱头引发热议:它用14小时自主完成了CUDA内核优化,实现35.7倍加速(对比人工基线的2.6倍),一度被调侃为"CUDA专家被冲了"。

GLM-5.2 的发布走的是"先给能力、后补跑分"的节奏:

  • 2026年6月13日:面向 GLM Coding Plan 全量付费用户(Lite/Pro/Max/团队版)开放试用,此时官方没有同步公布任何跑分表
  • 2026年6月16-17日:API 正式上线,模型权重在 Hugging Face、ModelScope 上以 MIT协议完全开源,允许自由下载、私有部署与商用

架构上,GLM-5.2 是一个约 744-753B 总参数的 MoE(混合专家)模型,每次前向推理约 40B 参数被激活(256个专家+1个共享专家的路由设计),采用类似 DeepSeek 的稀疏注意力机制;上下文窗口做到 1M tokens,官方强调"可稳定无损使用",而不是挂个数字实际会退化的那种。公开信息还提到训练部分使用了华为昇腾(Ascend)芯片,这也常被拿来作为国产算力自主可控叙事的一个例证。

分发渠道上,智谱这次依然是双线并行:面向国内开发者的 bigmodel.cn(人民币计费、国内直连)和面向海外开发者的国际品牌 Z.ai(美元计费,可信用卡直接注册,模型也已同步上架 OpenRouter、DeepInfra、Fireworks、NVIDIA NIM 等第三方推理平台)。另外还有一条专门面向编程场景的订阅通道——GLM Coding Plan(对标 Claude Code 的编程订阅套餐),按5小时/周用量配额计费,官方报价 Lite 每月$18、Pro每月$72、Max每月$160(当前有促销,Lite 低至约$12.6/月),高峰时段配额消耗为3倍、非高峰2倍。上线当天前端做了购买数量限制,结果被开发者用脚本破解抢购,从侧面说明需求远超官方预期。

二、为什么突然全网刷屏:5个真实原因

把各方报道交叉印证后,能站得住脚、按解释力排序的原因大致是这5条。

1. 跑分 + 价格双杀,且有第三方权威榜单背书

这是解释力最强的一条,具体数字如下:

  • SWE-bench Pro:GLM-5.2 得分 62.1,高于 GPT-5.5 的 58.6
  • FrontierSWE:74.4% vs GPT-5.5 的 72.6%
  • PostTrainBench:34.3% vs GPT-5.5 的 25.0%
  • MCP-Atlas(工具调用能力):77.0 vs GPT-5.5 的 75.3,非常接近 Claude Opus 4.8 的水平
  • 价格:API标准价约 $1.40/M输入、$4.40/M输出,而 GPT-5.5 是 $5/$30——约六分之一的成本

更关键的是第三方权威验证:Artificial Analysis Intelligence Index v4.1 给出 51分,是当前所有开源权重模型里最高分,被称为"开源新王者";在有数百万全球用户参与盲测的 Code Arena 编程竞技场上,GLM-5.2 拿到全球可用模型第二(仅次于 Claude 一款代号 "Fable-5" 的最新闭源编程模型),开源模型第一。这种"不是自己说了算、第三方盲测也认"的验证,是它区别于一般国产模型自吹跑分的关键。

值得一提的是,GLM-5.2 在国产模型内部也不是"最便宜"的那一档——它的 $1.40/M 输入价格,比同样国产的 DeepSeek V4 Pro(约 $0.87/M)还贵出约5成。行业里对这两家的定位描述是:DeepSeek 主打"极致性价比、数学和竞赛编程更强",GLM 主打"软件工程能力更强、价格中间档"。这个细分说明"性价比之王"在国产模型里也不是单一维度的排位赛,选型时还要看具体任务类型。

2. 真实企业"倒戈"案例,把炒作变成了商业信号

Coinbase 公开宣布将日常代码审查、文档总结等默认模型从 Anthropic/OpenAI 切换为 GLM-5.2(和 Moonshot 的 Kimi K2.7),在 token 用量持续暴涨的情况下,整体 AI 支出削减近50%。这被 X/Twitter 上多个账号称为"中国 AI 击败美国 AI 的标志性时刻"。报道同时提到 Snowflake、AI 创业公司 Lindy 等也在转向同类中国开源模型,形成对 Anthropic/OpenAI 企业定价的直接下行压力。这类真实迁移案例的传播力,远超单纯的跑分新闻,是这波"出圈"的核心助推。

3. 开发者社区口碑驱动的自发扩散

Hacker News 上多条独立帖子登上高位(如"GLM 5.2 Is Out""GLM-5.2 is the new leading open weights model on Artificial Analysis""GLM 5.2 vs. Opus"等),其中一条获得915分、444条评论。知名 AI 评论者 Nathan Lambert(interconnects.ai)评价它为"开放 Agent 领域的质变",称几乎所有他尊重的 AI 评论者用过后都在称赞,并把这种社区共识程度类比为仅次于 DeepSeek R1 发布时的震动——这是很高的评价。实操层面,GLM-5.2 是第一个装进 Claude Code、Cline、Roo Code、OpenCode 等主流编程 Agent 工具链后"用起来顺手"的开源模型,而不只是跑分好看但实际 Agent 场景表现割裂。这个"体感"门槛此前从未被开源模型跨过。

4. GLM-5.1 已经预热了叙事,5.2 是延续而非孤立事件

两个月内的快速迭代进一步强化了"中国实验室发布节奏碾压式领先"的印象,HN 评论区有人直接感叹:"The pace from China is just brutal now. GLM, Qwen, Kimi, DeepSeek." 这种连续性本身也是热度的组成部分。

5. 争议和质疑反而增加了话题度

围绕 GLM-5.2 有几条争议同时在发酵:一是"蒸馏 Claude"之争——有工程师认为它未必依赖蒸馏美国模型也能达到高水平,但也有一种理论认为,Claude 在中国大陆被限制访问后,需求转移到各种 API 中转/代理平台,这些平台可能沉淀了大量真实开发者使用 Claude 的完整交互数据(提示词、代码上下文、报错、多轮修正、Agent 执行轨迹),这类数据比单纯蒸馏输出更有训练价值,帮助开源模型形成"数据飞轮"。二是跑分方法论质疑——PostTrainBench 上 GLM-5.2 从几个月前的第22名跳到第1名,被质疑该测试没有隐藏测试集,容易被针对性优化;创意写作等非编程任务上的表现明显弱于编程任务,暴露"偏科"。三是部署门槛现实——744B 参数模型即使 FP8 也要约750GB 显存,4-bit 量化仍需约400GB,普通开发者根本无法本地自部署,"开源权重"更多是生态/营销意义而非"人人可跑"。四是监管讨论——DeepSeek 已被禁止用于美国政府设备,有提案要将禁令扩大到联邦承包商,可能覆盖包括智谱在内的整个中国主流 AI 生态。

三、性价比硬数据:GLM-5.2 vs Claude Fable 5

先把两边的定价摆在桌面上。Claude Fable 5(模型ID claude-fable-5)是 Anthropic 目前面向公众发布的最强模型,主打最高难度推理和长程 Agent 任务,不是走性价比路线——它的定价甚至高于 Opus 档位。

项目GLM-5.2Claude Fable 5
开发商智谱AI / Z.aiAnthropic
定位开源权重(MIT协议)性价比旗舰面向最高难度推理/长程Agent任务的最强已发布模型(非性价比定位)
输入价格(每百万tokens)$1.40$10.00
输出价格(每百万tokens)$4.40$50.00
上下文窗口1M tokens1M tokens(默认即最大值)
最大输出官方未统一公布上限128K tokens
思考模式可控/可选始终开启,无法关闭
数据留存要求无特殊强制要求强制30天留存,不支持零数据留存(ZDR)

按这个表格直接算比例:输入价格上,Fable 5 是 GLM-5.2 的 10.00 / 1.40 ≈ 7.1倍,也就是说 GLM-5.2 输入端便宜约7倍;输出价格上,Fable 5 是 GLM-5.2 的 50.00 / 4.40 ≈ 11.4倍,GLM-5.2 输出端便宜约11倍。这两个比例数字,是本文"性价比全面超过"这个判断最直接的证据。

一个必须说清楚的前提

上一节里 GLM-5.2 的跑分优势(SWE-bench Pro、Code Arena、Artificial Analysis)全部是对比 GPT-5.5 得出的,不是对比 Claude Fable 5。目前公开报道里,两者最接近的"对撞"信号是 Code Arena 的排名——GLM-5.2 全球第二,仅次于 Fable-5——这是一个排名,不是逐项跑分的分差,不能倒推出"GLM-5.2 在具体某个基准上领先/落后 Fable 5 多少分"。

为了不凭空猜测,我们专门为这篇文章做了一轮针对性检索:"GLM-5.2 vs Claude Fable 5 benchmark"。检索确实能找到几篇第三方博客(例如某编程社区博客提到用"Kilo Code's Planning Benchmark"测试后得出"近乎打平、但价格只要约十分之一"的结论),但这些内容普遍没有披露具体测试方法、样本量或原始分数,属于个人/社区自发测评,不是像 SWE-bench Pro、Code Arena 那样有公开方法论和大规模盲测支撑的权威基准。因此本文不会引用这类未披露方法论的数字作为定论,而是老老实实地说:截至目前,没有一份权威的、公开方法论的 GLM-5.2 vs Claude Fable 5 直接对撞跑分。下面两节,我们改用定位和定价的角度做定性推理。

四、诚实地说:两者根本不是同一个赛道

"性价比全面超过"是一个比值判断,不是"GLM-5.2 在绝对能力上更强"的判断——这两者必须分开说清楚,否则就是在误导读者。

Claude Fable 5 是 Anthropic 目前公开发布里最能打的模型,专门用来处理最难的推理任务和需要长时间自主运行的 Agent 工作——单次请求在困难任务上跑上十几二十分钟是正常现象;它的思考过程始终开启、无法关闭;企业要用它,组织的数据留存策略必须满足30天最低要求,不支持零数据留存。这些特性合在一起说明一件事:Fable 5 从产品定位上就不是拿来打价格战的,它的定价($10/$50)甚至高于 Anthropic 自己的 Opus 4.8($5/$25)和 Sonnet 5($3/$15)——是 Anthropic 目前最贵的一档模型。

GLM-5.2 的定位则完全不同:它要打的是"足够好、够用来干真活,但价格只是零头"这个细分市场——而这恰好是 AI API 中转站用户(也就是本站大多数读者)真正在意的场景:不追求跑赢一切基准的绝对能力天花板,而是要在预算有限的情况下,拿到接近前沿水平的编程/Agent能力。

所以本文对"性价比全面超过"这句话的准确表述是:对中转站用户真正关心的价值计算——用远低于顶级定价的成本,换到接近前沿水平的编程/Agent能力——GLM-5.2 是决定性的赢家;这不等于"GLM-5.2 在所有维度上都是比 Fable 5 更强的模型",后面这个绝对能力层面的说法,目前没有可靠数据支撑,本文不会这么讲。

换个角度想会更直观:Fable 5 的目标用户,是那些愿意为"多几个百分点的正确率"支付溢价的场景——金融建模、安全审计、法律合规这类一次出错代价极高、且组织本身能承担30天数据留存合规成本的任务,这时候多花几倍的钱去买更高的确定性是划算的。而中转站服务的绝大多数场景——日常代码补全、单元测试生成、文档总结、中小型重构、Agent自动化脚本——恰恰是"多几个百分点的正确率"边际价值有限、但"每天调用量大、成本敏感"的场景,这正是 GLM-5.2 的价格结构专门为之优化的方向。用错误的标尺(绝对能力天花板)去评判 GLM-5.2,或者用错误的标尺(日常任务性价比)去评判 Fable 5,都会得出误导性的结论。

五、更公平的对比:GLM-5.2 vs Sonnet 5 / Opus 4.8

既然 Fable 5 从来没把自己定位成"性价比之选",一个更公平的同级对照组,其实是 Anthropic 自己面向日常编程/Agent场景定价的两档模型:Sonnet 5($3/$15)和 Opus 4.8($5/$25)。

模型输入 $/M输出 $/MGLM-5.2输入便宜多少倍GLM-5.2输出便宜多少倍
Claude Sonnet 5$3.00$15.00≈2.1倍≈3.4倍
Claude Opus 4.8$5.00$25.00≈3.6倍≈5.7倍
Claude Fable 5$10.00$50.00≈7.1倍≈11.4倍
GLM-5.2$1.40$4.40

即便换成这两档更"平民"的 Anthropic 模型做对照,GLM-5.2 依然便宜数倍——只是差距不像对 Fable 5 那样夸张。同样需要提醒:这里也没有一份公开的 GLM-5.2 vs Sonnet 5 / Opus 4.8 逐项跑分对撞,上面的推理仍然是"定价对照 + 已知的 GPT-5.5 基准表现"这个方向性判断,而不是逐分对比。想知道自己的具体工作负载在哪个模型上更划算,最靠谱的办法还是拿真实任务各跑一遍再比较。

六、国内读者关心的:去哪接入GLM-5.2

这里有一个和 GPT/Claude 完全不同的前提:GLM、DeepSeek、Qwen 这类国产模型在中国大陆本身就有官方直连(智谱的 bigmodel.cn、深度求索、阿里云百炼等),不存在"被墙"需要翻墙才能用的问题。所以中转服务对 GLM-5.2 的核心价值,和它对 GPT/Claude 的核心价值是不一样的:

  • 多模型统一账号、统一计费——一个中转站面板同时管理 GPT、Claude、GLM、DeepSeek,不用在四五个官网之间来回切换 Key 和账单
  • 可能比官方价格更低——部分中转商靠批量采购或自建推理集群拿到折扣价,再以低于 bigmodel.cn 官方牌价的价格转售
  • 免大陆手机号实名认证——面向部分不方便或不愿意用大陆身份直接注册 bigmodel.cn 的用户(例如海外开发者、注重隐私的个人开发者)

根据我们的调研,已经有中转渠道把 GLM-5.2 和 DeepSeek/Qwen 打包销售,例如以"直连官方"为卖点的 DuiAPI,以及本站已收录测评的硅基流动 SiliconFlow——后者严格来说不是传统意义上批量采购官方账号转售的中转站,而是直接托管开源模型权重、自研推理引擎的云服务商,DeepSeek、Qwen、GLM 等 100+ 模型都在它的模型广场里,本身就是国产开源模型上云的主力选项之一。

如果更看重"第一手、官方直供",也可以直接走智谱自己的通道:国内 bigmodel.cn、国际 z.ai,本站的智谱AI GLM测评已经在跟踪 GLM-5.2 的实时定价(输入$1.40、输出$4.40,Context缓存命中后输入折扣最高80%)。对已经在用某个中转站接入 GPT/Claude 的个人开发者来说,最省事的路径往往是先去检查一下自己现有的那个中转站是否已经上架 GLM-5.2,而不是为了一个模型再单独多开一个账户——完整的中转站横向对比可以看本站的 AI API中转站对比看板

实际选型时,建议按三个维度快速筛选:第一,是否已经上架 GLM-5.2(不少中转站的模型列表更新滞后,只有旧版 GLM-4.7 系列,需要在下单前确认清楚);第二,计费单位是否透明(按官方 $/M tokens 折算比例定价,还是按自定义"点数"计费——后者容易在汇率和加价率上做手脚,不方便比价);第三,是否支持 Anthropic/OpenAI 双协议兼容接入,这样 Claude Code、Codex CLI 等现成工具链可以直接切换模型名调用 GLM-5.2,而不需要额外改造代码。这三条基本可以过滤掉大部分"占坑但体验差"的渠道。

⚠️ 选中转商时值得关注的一点:多篇报道提到,Claude 被限制访问大陆后,用户转投中转/代理平台,这些平台完整的请求日志(提示词、代码上下文、Agent 执行轨迹)理论上可能被留存甚至用于训练。选择中转服务商时,建议把"是否公开承诺不留存请求内容、不用于模型训练"作为一项评分标准,而不只是比价格和速度。

七、常见问题

Q:GLM-5.2 和 Claude Fable 5,我该选哪个?

A:如果你的任务需要最高的推理天花板、长时间自主运行的 Agent 流程,或者你的组织本身就需要 Fable 5 那套30天数据留存的合规模型,绝对能力和产品定位可能比价格更重要,这种情况下 Fable 5 更合适。但如果你和大多数中转站用户一样,日常需要的是"足够好用、价格可控"的编程/Agent能力,GLM-5.2 的性价比优势非常明显,值得优先尝试。

Q:GLM-5.2 真的能打过 Claude Fable 5 吗?

A:没有权威的直接对撞跑分。我们专门检索过,只找到个别未披露测试方法论的社区博客声称"近乎打平、价格只要约十分之一",这类说法不应被当作定论。已验证的跑分优势是相对 GPT-5.5,不是相对 Fable 5。

Q:普通开发者能自己本地部署 GLM-5.2 吗?

A:理论上因为 MIT 协议开源可以,但744B参数模型即使 FP8 精度也要约750GB显存,4-bit量化仍需约400GB,个人开发者基本不具备自建条件。"开源权重"目前更多是生态和授权层面的意义,而不是"人人都能在自己电脑上跑起来"。

Q:通过中转站用 GLM-5.2,数据安全吗?

A:视具体中转商的政策而定,没有统一答案。建议优先选择公开承诺不留存请求内容、不将用户数据用于训练的服务商,把这一条纳入你挑选中转站的评分标准之一。

Q:GLM-5.2 和同为国产开源的 DeepSeek 相比呢?

A:两者不是同一个价位段的直接竞品。DeepSeek V4 Pro 输入价约 $0.87/M,比 GLM-5.2 更便宜,数学和竞赛编程场景更突出;GLM-5.2 定价略高但软件工程/Agent场景的跑分更强,且在 Code Arena 上排到了全球第二。预算极度敏感、任务偏数学计算的场景可以优先试 DeepSeek,偏工程/Agent自动化的场景可以优先试 GLM-5.2,两者都值得放进同一个中转账号里按任务切换。

Q:Coinbase 这类企业级降本案例,普通个人开发者能复制吗?

A:能复制的是思路,而不是原样照搬。Coinbase 的做法是把默认模型从 Anthropic/OpenAI 切换到 GLM-5.2 + Kimi K2.7,同时保留高价值场景(例如更复杂的架构决策)仍然用顶级闭源模型兜底——这是一种"按任务分层调用"的成本结构,而不是全盘替换。个人开发者完全可以在自己的中转站账号里配置类似的分层规则:日常代码补全、单元测试、文档摘要默认走 GLM-5.2 或 DeepSeek,遇到棘手的架构级问题再手动切到 Sonnet 5 / Opus 4.8 甚至 Fable 5,用最低的综合成本覆盖最广的场景。

总结:性价比赢在哪、不该拿它证明什么

  • 价格差是真实且巨大的:GLM-5.2(约$1.40/$4.40)相对 Claude Fable 5($10/$50),输入端便宜约7倍,输出端便宜约11倍
  • GLM-5.2 的跑分优势是对比 GPT-5.5,不是对比 Fable 5——目前没有权威的直接对撞跑分,不要把两者混为一谈
  • 两者根本不在同一条赛道:Fable 5 是不计成本的前沿推理/长程Agent旗舰,GLM-5.2 是"够用、便宜"的性价比之选,"性价比全面超过"说的是后者这个赛道,不是绝对能力
  • 更公平的同级对照是 GLM-5.2 vs Sonnet 5 / Opus 4.8,即便如此 GLM-5.2 依然便宜数倍
  • 对国内读者,GLM-5.2 本身不存在"被墙"问题,中转渠道的价值在于统一账号计费、可能更低的价格、以及免大陆实名认证

如果你的工作负载对成本敏感、又需要接近前沿水平的编程/Agent能力,GLM-5.2 值得认真一试;如果你需要的是不计成本的绝对能力天花板,Fable 5 仍然是更合适的选择。