如果只记一组数字,那大概是"70倍、180倍、2%"——这是本轮横评里,输入价最便宜和最贵的模型之间的价差倍数、输出价的价差倍数,以及缓存命中价格最低能压到未命中价的百分之几。这三个数字合在一起,勾勒出2026年8月这个时间点上AI大模型定价的真实图景:它早已不是一张"越贵越强"的简单排行榜,而是一整套由缓存折扣、长上下文阶梯、峰谷电价、推理强度开关、订阅与按量并存等多重机制交织出来的复杂账本。更麻烦的是,这本账本变化的速度远超大多数人的想象——就在我们这次调研的窗口期内,Claude Opus 5悄悄取代了Opus 4.8、Qwen3.8-Max从没有独立定价的"预览版"一夜之间转正、DeepSeek被媒体曝出即将上线全行业唯一的分时段加价机制,而Google那个被寄予厚望的Gemini 3.5 Pro,发布日期已经从6月推迟到7月又推迟到"待定"。这篇文章的目标,就是把这本账本摊开,逐条讲清楚。
本文覆盖OpenAI、Anthropic、谷歌、DeepSeek、月之暗面(Kimi)、阿里(Qwen)、智谱(GLM)、xAI、MiniMax九家厂商的当前主力高性能模型,方法上分两层:一是复用本站此前已发布测评(DeepSeek V4 Flash、Grok 4.5性价比、GLM-5.2、Kimi K3 vs Qwen3.8-Max-Preview、OpenAI Astra预告、MiniMax H3等)里已经交叉验证过的定价数字;二是针对本轮变化最快的几个点做独立联网复核,凡是不同信源打架的地方,本文如实标注"未验证"或"信源冲突",不会为了凑出一个好看的数字而编造。发布前,我们还专门针对DeepSeek的峰谷电价传闻和Qwen3.8-Max的转正定价做了一轮额外核实,下文会具体讲这轮核实带来了什么修正。
目录
- 一、全景价格总表:九大厂商现役阵容一次看全
- 二、OpenAI —— GPT-5.6三档降价,Astra还是个问号
- 三、Anthropic —— Opus 5同价换代,Fable/Mythos 5是价格天花板
- 四、谷歌 —— 真正在卖的旗舰其实是3.1 Pro,3.5 Pro仍未发布
- 五、DeepSeek —— 从"永久降价75%"到"峰谷电价"(含最新核实)
- 六、月之暗面/Kimi —— K3单价不变,但思考锁死最高档
- 七、阿里/Qwen —— Qwen3.8-Max刚转正(含最新核实)
- 八、智谱/GLM —— 官方价格反而不是最低价
- 九、xAI —— Grok 4.5现役,4.6/4.7还在马斯克嘴上
- 十、MiniMax —— M3是文本/Agent旗舰,别和H3搞混
- 十一、真正决定账单的计价机制:缓存、峰谷、推理强度、速度分级
- 十二、中转站视角:开放权重和闭源模型是两套完全不同的价格逻辑
- 十三、六条趋势总结
- 十四、数据时效性声明与发布前核实结果
- 十五、结论:这张表该怎么用
一、全景价格总表:九大厂商现役阵容一次看全
先把最核心的东西摆出来。下表按厂商分组,覆盖九家厂商当前在售(GA)的主力模型,输入价从低到高大致排序,末尾附上尚未发布、目前只有传闻或预告的几个型号,方便对照。所有数字均为2026年8月发稿时点的官方或多方交叉验证价格,无法交叉验证的地方直接写"未验证",不强行给出唯一数字。
| 厂商 | 模型 | 状态 | 输入 $/M | 输出 $/M | 上下文 | 关键备注 |
|---|---|---|---|---|---|---|
| DeepSeek | V4-Flash | 已GA(0731正式版) | $0.14(缓存命中$0.0028) | $0.28 | 1M | 无高峰加价,全场输入价最低梯队之一 |
| 阿里/Qwen | Qwen3.6-35B-A3B | 已GA | $0.14 | $0.90 | — | 全场最便宜的多模态模型 |
| DeepSeek | V4-Pro | 已GA | $0.435(非高峰) | $0.87(非高峰) | 1M | 官方已宣布峰时2倍加价机制,截至发稿仍未正式生效,详见第五节 |
| MiniMax | M3(文本/Agent模型) | 已GA(6月1日) | $0.30(列表价$0.60"永久5折") | $1.20 | 1M(超512K翻倍) | 428B总参/23B激活MoE,原生多模态+电脑操作 |
| MiniMax | M2.1(上代) | 已GA | $0.30 | $1.20 | 262K级别 | 与M3同价,M3卖点是上下文和速度 |
| 智谱/GLM | GLM-5.2 | 已GA(6月13发布,MIT开源) | $1.40(缓存命中$0.26) | $4.40 | 1M(128K max输出) | 官方价 vs 第三方托管中位数约$0.55/$1.85,见第八/十二节 |
| Qwen | Qwen3.8-Max | 8月3日刚转正式发布 | $2.00 | $6.00 | 1M(65,536 max输出) | 2.4T总参/约95B激活MoE,开放权重"下周"放出,本文已核实 |
| xAI | Grok 4.5 | 已GA(7月8日) | $2.00(缓存命中$0.50) | $6.00 | 500K(比上代反而缩小) | 闭源多模态旗舰里性价比最高,非全网最低价 |
| OpenAI | GPT-5.6 Luna | 已GA(7月30日降价80%) | $0.20(缓存写$0.25/读$0.02) | $1.20 | 1.05M(272K后阶梯) | 长上下文阶梯价:$0.40/$1.80 |
| Moonshot | Kimi K2.7(上代) | 已GA | $0.95(缓存命中$0.19) | $4.00 | 262,144 | 比K3便宜但上下文小得多,定位"轻量续作" |
| Anthropic | Claude Sonnet 5 | 已GA | $3.00(促销$2.00,至2026-08-31) | $15.00(促销$10.00) | 1M | 促销结束恢复标准价,支持2576px高清视觉 |
| OpenAI | GPT-5.6 Terra | 已GA(7月30日降价20%) | $2.00(缓存写$2.50/读$0.20) | $12.00 | 1.05M | 长上下文阶梯价:$4.00/$18.00 |
| Anthropic | Claude Opus 5(替代Opus 4.8) | 已GA(7月24日发布) | $5.00 | $25.00 | 1M(128K max输出) | 沿用Opus 4.8同价位,新增effort低/中/高开关 |
| OpenAI | GPT-5.6 Sol | 已GA | $5.00(缓存写$6.25) | $30.00 | 1.05M | Fast模式2倍价格换2.5倍速度 |
| Moonshot | Kimi K3 | 已GA(7月16日发布) | $3.00(缓存命中$0.30) | $15.00 | 1M(全上下文统一单价) | 思考模式锁定最高强度无法关闭,另有订阅档 |
| Anthropic | Claude Fable 5 | 已GA | $10.00 | $50.00 | 1M(默认即最大值) | 思考过程始终开启,需30天数据留存 |
| Anthropic | Claude Mythos 5 | 已GA但限制访问 | $10.00 | $50.00(较受限Preview阶段$25/$125大幅下调) | 与Fable同源 | 仅限受信任伙伴+特定生物研究者,非自助渠道 |
| 谷歌 | Gemini 3.5 Flash-Lite | 已GA | $0.30 | $2.50 | — | 轻量档 |
| 谷歌 | Gemini 3.6 Flash | 已GA | $1.50 | $7.50 | — | 号称长程Agent任务token成本最多降低65% |
| 谷歌 | Gemini 3.5 Flash | 已GA | 第三方数字矛盾($0.15~$1.50不等) | 约$9.00(同样未交叉验证) | — | 本文不采信无法交叉验证的单一数字 |
| 谷歌 | Gemini 3.1 Pro(当前实际在售最高档) | 已GA(Preview) | $2.00(≤200K)/$4.00(>200K) | $12.00(≤200K)/$18.00(>200K) | 200K阶梯 | 个别信源称降至$1/$6,未交叉确认,本文不采信 |
表格之外,还有几个名字目前只存在于预告和传闻里,完全没有官方定价,我们同样列出来,但请读者不要误以为它们"即将有具体价格"——下表所有列都是"未公布"或"仅为传闻":
| 厂商 | 模型 | 状态 | 定价 | 备注 |
|---|---|---|---|---|
| 谷歌 | Gemini 3.5 Pro | 未正式发布(仅"与合作伙伴测试中",GA日期已从6月推迟至7月又推迟至"待定") | 未公布 | 传闻200万token上下文,未获官方确认 |
| 谷歌 | Gemini 4 | 训练中,未发布 | 未公布 | 皮查伊7月26日受访称"体量远大于以往",参照历史节奏预计11-12月发布 |
| xAI | Grok 4.6 | 未发布(马斯克称约8月7日) | 未公布 | 1.5T参数,仅为马斯克公开言论,非官方确认 |
| xAI | Grok 4.7 | 未发布(4.6之后"数周") | 未公布 | 2.1T参数,同样仅为马斯克公开言论 |
| OpenAI | Astra | 仅预告,未发布 | 未公布 | "2000美元"成本估算用的是现有Sol模型价格作参照,不是Astra自己的报价 |
说明一下表格里几个计价类型的含义:per-token指纯按量计费;分时电价指同一单价体系内按时段浮动;会员订阅并存指同时存在按量计费API和包月订阅两套体系,二者不是同一计价逻辑,不能直接换算比较——这一点在本站此前Kimi K3 vs Qwen3.8-Max-Preview的测评里已有详细论证。接下来,我们按厂商逐一拆开讲。
二、OpenAI —— GPT-5.6三档降价,Astra还是个问号
Sol、Terra、Luna是OpenAI当前唯一在售的主力线,7月30日刚对Terra、Luna做了大幅降价(Terra降20%、Luna降80%),Sol维持不变——这被普遍解读为对企业客户"AI支出ROI存疑"以及中国低价开源模型竞争压力的直接回应。三档统一1.05M上下文窗口、128K最大输出,但都在输入超过272,000 token后进入长上下文阶梯价(价格翻倍左右):Luna的$0.20/$1.20涨到$0.40/$1.80,Terra的$2/$12涨到$4/$18,Sol的$5/$30涨到$10/$45。
Sol还独有一个"Fast模式":2倍价格换2.5倍速度——这是本轮横评里唯一把"响应速度"本身明码标价的厂商,其余厂商的"更快"要么免费附赠,要么根本没有这个选项。至于下一代主力模型Astra,本站此前已有专门文章拆解:它是8月1日通过一篇数学论文博客"顺带"透露的代号,截至发稿官方尚未公布发布日期、模型规模、上下文窗口、API定价——网传"2000美元算力成本"用的也是现有Sol模型的价格做参照物,不能理解成"Astra定价约为此"。换句话说,如果你现在就想为Astra的价格做预算规划,答案是:还不到时候。
三、Anthropic —— Opus 5同价换代,Fable/Mythos 5是价格天花板
本轮横评里一个容易被忽略、但值得单独拎出来讲的变化是:Claude Opus 5已于7月24日发布,取代Opus 4.8成为当前旗舰,官方定位是"以Fable 5一半的价格逼近其前沿智能水平",而它沿用了Opus 4.8完全相同的定价($5/$25)。这意味着如果你手头还留着"Claude Opus 4.8"这个型号名字的旧规划,现在应该理解为"已被同价位的继任者替换",而不是"仍在售的最新旗舰"。Opus 5新增了"努力度"(effort)低/中/高开关,但这不是一个独立的价格分层——它不改变单价,只是通过控制推理强度、进而改变实际token消耗量来间接影响账单,价目表本身只有一个单价。
Sonnet 5目前有促销价$2/$10(至2026-08-31),标准价$3/$15——如果你读到这篇文章的时间点已经过了8月底,需要自行核实是否已恢复标准价。Fable 5($10/$50)定位非性价比路线,思考过程始终开启无法关闭,企业客户需接受30天数据留存(不支持零数据留存)。Mythos 5(同为$10/$50,与Fable同源但安全护栏更少)价格已经从今年4月起限制访问阶段的$25/$125大幅下调,但依然不通过公开API/claude.ai/自助渠道提供,仅限"Project Glasswing"受信任伙伴与特定生物安全研究者——普通开发者目前拿不到它,价格再低也无从谈起接入。
四、谷歌 —— 真正在卖的旗舰其实是3.1 Pro,3.5 Pro仍未发布
这里需要先纠正一个很容易被搞混的点:Google在5月I/O上预告的Gemini 3.5 Pro截至8月5日仍未正式发布——GA日期已经从6月推迟到7月,7月21日官方口径仍是"与合作伙伴测试中",没有给出新日期。目前没有官方定价、没有官方上下文窗口数字(传闻200万token未获确认)。也就是说,如果你在网上看到任何声称"Gemini 3.5 Pro已经开卖,价格是多少多少"的说法,那基本可以判定是不实信息。
当前实际在售的最高档,是Gemini 3.1 Pro (Preview):≤200K上下文$2/$12,超过200K后$4/$18;有个别信源提到近期降至$1/$6,但缺乏官方文档交叉确认,本文不采信为定论。轻量档方面,Gemini 3.6 Flash($1.50/$7.50)、Gemini 3.5 Flash-Lite($0.30/$2.50)已确认;但Gemini 3.5 Flash的定价本次依然无法交叉验证——多个信源互相矛盾(输入价从$0.15到$1.50不等),这与本站DeepSeek V4 Flash测评此前已经点名的问题完全一致,本文同样选择不采信任何单一数字,而不是为了凑数字硬编一个。至于Gemini 4,仍在训练中,皮查伊7月26日受访称"体量远大于以往",参照历史发布节奏预计11-12月推出,无任何定价信号。顺带一提,Google的Batch API全线5折、24小时内出结果,缓存输入价约为未命中价的10%(90%折扣)。
五、DeepSeek —— 从"永久降价75%"到"峰谷电价"(含最新核实)
DeepSeek V4-Flash($0.14/$0.28)在7月31日从Preview转入0731正式公测版,架构参数不变,纯靠重新训练就把Agent类跑分大幅拉高;官方价格维持不变,无高峰加价机制,账单可预测性是它相对V4-Pro的一个卖点。真正值得单独讲的是V4-Pro:本次调研发现的一个此前站内测评未覆盖的最新变化是——据多家媒体报道,DeepSeek在"数周前刚永久下调V4-Pro价格75%"之后,又转向对V4-Pro新增高峰时段(北京时间9:00-12:00、14:00-18:00)2倍加价机制,这是本轮横评里唯一采用"分时电价"模式的主力厂商,与Kimi K3"全上下文统一单价、不因时段浮动"形成鲜明对比。
发布前核实:DeepSeek峰谷电价截至发稿仍未正式生效,且加价范围覆盖输入输出全部计费项
由于这条变化被原始调研标注为"信息可能已过时",我们在发布前专门做了一轮独立联网复核。结果确认两件事:第一,截至2026年8月初,DeepSeek官方定价页面显示的仍是单一费率,多个第三方定价追踪站点在交叉引用官方文档后明确写道"峰时加价机制已宣布,但生效日期尚未公布,目前尚未正式启用"——也就是说,本文发稿时你实际付的还是非高峰价,不用现在就担心账单翻倍。第二,我们找到的信息比原始调研更完整的一点是:这次2倍加价不是只涨output价格,而是被多个信源明确描述为覆盖"全部计费项"——即高峰时段缓存命中输入价、缓存未命中输入价、输出价会同步涨到非高峰价的2倍(例如非高峰输出6元/M对应高峰12元/M,输入同理翻倍),而不是此前信源里"仅output端确认"的说法。建议读者在这套机制真正上线后,直接以DeepSeek官方定价页面(api-docs.deepseek.com)为准。
缓存折扣方面,DeepSeek几乎归零:V4-Flash缓存命中$0.0028(约98%折扣),V4-Pro缓存命中约$0.0036——是本轮横评所有厂商里缓存折扣力度最大的,对"反复处理同一份长文档/长代码库"的场景尤其划算。
六、月之暗面/Kimi —— K3单价不变,但思考锁死最高档
Kimi K3($3/$15,缓存命中$0.30,90%折扣)7月16日发布、7月27日开放完整权重(2.8T参数MoE,权重文件MXFP4量化后约1.4TB,是当时人类历史上体量最大的开源权重模型之一),采用修改版MIT协议开放商用。它全上下文窗口(最高1M)统一单价,不像OpenAI/Google那样有"超过X token后涨价"的阶梯,账单可预测性是其卖点之一。
但有一点需要单独提醒:K3的思考模式默认强度锁定最高档(max)且无法关闭,这意味着单价虽然不变,实际输出token消耗量天然更大,真实账单可能高于"单价数字"直观暗示的水平——这是一种通过"隐性提高token消耗量"而非"直接提高单价"实现的变相加价,值得中转站用户单独留意。因需求暴涨,Moonshot曾于7月19日暂停新用户订阅(分批重新开放),是否已完全恢复需读者自行核实最新状态。上一代Kimi K2.7(Code变体,$0.95/$4,缓存命中$0.19,262,144上下文)目前仍在售,是预算更敏感但不需要百万级上下文场景的备选项。另外,会员订阅体系(Moderato $19/月、Allegretto $39/月、Allegro $99/月、Vivace $199/月)与按量计费API并存,是两套独立的计价逻辑,Allegro/Vivace档解锁K3的百万token超长对话能力。
七、阿里/Qwen —— Qwen3.8-Max刚转正(含最新核实)
本次调研期间发生了一个重要状态变化:Qwen3.8-Max已于8月3日正式发布(此前它还只是"Preview",没有独立标准定价页,只能通过Token Plan订阅或Qoder/QoderWork渠道访问,第三方需要反推估算价格)。正式发布后,官方现在明码标价$2.00/M输入、$6.00/M输出,1M上下文窗口全量单价覆盖、无长文本附加费,规模为2.4万亿总参数(约950亿激活)MoE,属于阿里迄今规模最大、能力最强的旗舰;开放权重计划在"下周"(发布后一周内)正式放出供下载。
发布前核实:Qwen3.8-Max定价未变,且能从另一个角度独立印证
考虑到这是本轮调研窗口内刚发生的状态变化(Preview转GA),我们在发布前又单独复核了一次。结果是:$2.00/$6.00这组数字截至发稿仍然准确,没有变化。有意思的是,我们找到一个可以交叉印证这组数字的角度——多个信源提到Qwen3.8-Max的海外定价基准,被描述为"约为Claude Opus 5输入价的40%、输出价的24%":Opus 5是$5/$25,40%和24%换算出来正好就是$2.00和$6.00,两个独立信源路径对上了同一个答案,这让我们对这组价格的可信度更有把握。另外,"开放权重下周放出"的计划也在这轮复核中得到了额外信源佐证,方向不变。
这意味着此前站内"Kimi K3 vs Qwen3.8-Max-Preview"测评里"这笔账目前根本没法直接算"的结论,从8月3日起已经不再成立——现在双方都有官方$/M tokens标价,可以直接横向比较:Kimi K3输入价($3)是Qwen3.8-Max($2)的1.5倍,输出价($15)是后者($6)的2.5倍。另外,Qwen3.6-35B-A3B($0.14/$0.90)作为更轻量的多模态型号仍在售,是"全场最便宜的多模态模型"这个位置的占据者。
八、智谱/GLM —— 官方价格反而不是最低价
GLM-5.2($1.40/$4.40,缓存命中$0.26且当前缓存存储限时免费)6月13日以试用形式亮相、3天后权重以MIT协议完全开源,1M上下文窗口、128K最大输出。它最特别的地方,是本轮横评里最典型的"官方价不是最低价"案例——第三方托管平台(Together AI、Fireworks、DeepInfra、SiliconFlow、OpenRouter等)的中位数价格约为$0.55/$1.85,OpenRouter上甚至能见到低至$0.29/M输入的报价,相当于官方价的约2-5折。这背后的机制我们会在第十二节详细展开。此外,GLM Coding Plan订阅(对标Claude Code)分为Lite官方报价$18/月(促销低至约$12.6/月)、Pro $72/月、Max $160/月,高峰时段配额消耗3倍、非高峰2倍。
九、xAI —— Grok 4.5现役,4.6/4.7还在马斯克嘴上
Grok 4.5($2/$6,缓存命中$0.50,75%折扣)7月8日发布,官方context window为500K token——值得一提的是这比上一代Grok 4.3的1M上下文反而缩小了,是本轮横评里唯一出现"上下文窗口不进反退"的案例;超过20万token后进入更高阶梯价,但具体涨幅数字未见统一披露。它是闭源多模态旗舰里性价比最高的一档,但并非全网最低价。Grok 4.6(约1.5T参数)、Grok 4.7(约2.1T参数)均尚未发布,仅为马斯克7月24-28日期间在X上的公开表态(4.6约8月7日、4.7在4.6之后"数周"),不是xAI官方确认的发布信息,价格和上下文窗口目前完全空白。附带一提,xAI旗下语音模型Grok Voice Think Fast 2.0已于8月1日更新,定价为每分钟音频$0.08,与文本token计价不是同一计价体系。
十、MiniMax —— M3是文本/Agent旗舰,别和H3搞混
这里需要先厘清任务边界:MiniMax同期还发布了视频生成模型H3($0.13-0.14/秒,2K分辨率),但这是视频模型,不在本文"高性能文本/推理模型"的比较范围内,仅做区分说明。文本/Agent旗舰是M3(6月1日发布):428B总参数/约23B激活的MoE架构,采用MSA(MiniMax Sparse Attention)稀疏注意力机制,1M token上下文窗口,原生支持图像/视频输入及桌面电脑操作(native computer-use)。定价$0.30/M输入、$1.20/M输出——官方列表价原为$0.60/$2.40,"永久5折"促销后等于常态化的$0.30/$1.20,与上一代M2.1同价;单轮请求超过512K token后,该轮按2倍单价计费;缓存读价格$0.06/M。MiniMax M系列目前在国产开源阵营里属于价格中等偏低、但上下文窗口和多模态能力较突出的选项,已可通过SiliconFlow、WaveSpeed等第三方推理平台调用。
十一、真正决定账单的计价机制:缓存、峰谷、推理强度、速度分级
看完九家厂商的裸价格,还有一层更容易被忽略、但对实际账单影响可能更大的维度:各家在"缓存折扣""长上下文加价""峰谷电价""推理强度""响应速度"这几个机制上的处理方式天差地别。汇总如下:
| 机制类型 | 采用厂商/模型 | 具体情况 |
|---|---|---|
| 缓存命中折扣 | 几乎所有厂商都有,力度差异巨大 | DeepSeek最激进:命中价仅为未命中价的约2%;OpenAI各档约为未命中价的10%;Google缓存输入约为未命中价的10%;Kimi K3约10%(90%折扣);GLM-5.2约19%(约81%折扣);Grok 4.5为25%(75%折扣);Anthropic系列具体折扣比例本次未找到可交叉验证的官方数字,不编造 |
| 长上下文/长文本阶梯加价 | OpenAI(三档统一272,000 token阈值)、Google Gemini 3.1 Pro(200K阈值)、Grok 4.5(20万token阈值,涨幅未披露) | 都是"输入越长、单价越贵"的阶梯定价,与DeepSeek、Kimi K3"全上下文统一单价"形成对比 |
| 分时(峰谷)电价 | DeepSeek V4-Pro(唯一采用,截至发稿尚未正式生效) | 北京时间9-12点、14-18点全部计费项(输入+输出)拟翻倍,牺牲账单可预测性换取算力削峰填谷 |
| 速度分级计价 | OpenAI GPT-5.6 Sol"Fast模式"(唯一采用) | 2倍价格换2.5倍速度,是唯一把"响应速度"本身明码标价的厂商 |
| 推理强度/努力度开关(不改变单价,只改变消耗量) | Anthropic Opus 5"effort"低/中/高档;DeepSeek V4-Pro的Non-Think/Think High/Think Max三档;GLM-5.2的High/Max两档 | 同一单价下思考越强、实际消耗的输出token越多,账单是通过"消耗量"而非"单价"被推高的 |
| 思考模式强制常开,无法关闭 | Kimi K3(锁定最高档)、Claude Fable 5(思考过程始终开启) | 用户没有"关闭思考省钱"的选项,单价不变但实际支出天然更高 |
把这张表看完能得出一个结论:真正意义上把"思考/推理"本身当作独立计价维度、明码标出不同价格的,目前只有OpenAI(速度分级)和DeepSeek(时段分级)两家;其余厂商的"推理强度"选项都不改变单价本身,而是通过控制token消耗量间接影响账单——这是横向比价时最容易被忽略、但对实际支出影响可能最大的一个变量。换句话说,如果你只看"每M token多少钱"这一个数字就下结论,很可能会低估真实账单。
十二、中转站视角:开放权重和闭源模型是两套完全不同的价格逻辑
这是本站核心读者最关心的角度。我们把它拆成两类情况来看,因为它们背后的价格形成机制完全不一样。
12.1 开放权重模型:第三方托管竞价,官方价格反而不是最低价
DeepSeek V4系列、GLM-5.2、Kimi K3、Qwen3.6/3.8-Max、MiniMax M3都是开放权重模型,任何有算力的第三方都可以自己部署并对外销售推理服务,这带来一个官方模型不会出现的现象——多家推理服务商互相竞价,导致官方牌价不再是市场最低价。本次调研找到的最典型例子是GLM-5.2:官方(Z.ai/bigmodel.cn)标价$1.40/$4.40,但第三方托管平台(Together AI、Fireworks、DeepInfra、SiliconFlow、OpenRouter等)的中位数价格约为$0.55/$1.85,OpenRouter上甚至能见到低至$0.29/M输入的报价——相当于官方价的约2-5折。DeepSeek V4、Kimi K3同样存在多家第三方托管(Together、Fireworks、Modal、SiliconFlow、OpenRouter等)互相竞价的现象,只是本次没有找到像GLM-5.2这样具体、可引用的价差数字。这类"relay/聚合平台价格低于官方"的情况,本质上是开放权重带来的推理算力市场竞争,闭源模型不存在这个机制。
12.2 闭源模型:中转站价差来自汇率套利/批量采购/逆向协议,而非算力竞价
GPT、Claude、Gemini、Grok都是闭源模型,第三方无法自己部署,中转站只能靠转售官方账号额度赚差价,价差来源和开放权重模型完全不同:批量采购拿折扣价再加价转售、自定义"¥兑$"额度折算汇率(本质是变相打折)、订阅切片、企业云转发,乃至逆向网页协议/IDE免费配额这类灰色渠道。本站此前测评已经记录过大量具体案例:TokenRiver采用"1¥=$1"结算(相当于官方价约14%,注意这是此前已发布内容里的数字,未在本次重新核实,读者应以厂商最新页面为准);AIGCBest汇率约1.5¥/USD;AZAPI的Claude约¥2.5/USD(约官方价34%);柏拉图AI(bltcy)汇率1-2.5¥/USD。
本次独立联网检索也印证了同一现象仍在延续:截至2026年4月的一份第三方测评显示,某平台内部结算汇率¥2.4/$(相当于充值打3.3折)、另一平台¥2/$(约2.8折)、某平台GPT-5.1-codex限时价约为官方价的8.5折。这类闭源模型的中转价差,本质上不是"更便宜的算力",而是"更便宜的账号额度",价差幅度、稳定性和账号风险(掉包降级、跑路)都明显大于开放权重模型的第三方托管竞价,选型时不能简单套用同一个逻辑去评估两类中转服务的可信度。一句话总结这一节:比较"官方价"这个动作,对开放权重模型只是"起点",对闭源模型则接近"终点"——因为闭源模型的官方价就是价格天花板,中转站只能打折转售官方额度,不能自己重新定价算力。
十三、六条趋势总结
把九家厂商的价格、机制和中转站生态放在一起看,能提炼出几条比单个数字更有价值的规律:
- 开源/开放权重阵营在纯token单价上全面碾压闭源阵营:DeepSeek V4-Flash($0.14/$0.28)、Qwen3.6-35B-A3B($0.14/$0.90)常年占据输入价最低区间,与闭源阵营最贵的Claude Fable 5/Mythos 5($10/$50)相比,输入价差可达70倍量级、输出价差可达约180倍——这不是"打折"级别,是数量级差异。
- "官方最贵不等于官方最落后",闭源阵营现在也在打价格战:OpenAI 7月30日大幅下调Terra/Luna价格,Anthropic用Opus 5"以Fable 5一半价格逼近前沿水平"的方式补位中端,都是对开源模型价格压力的直接回应——但闭源阵营的"降价"更多发生在中低档模型上,旗舰档(Sol、Fable 5、Opus 5)价格纹丝不动,说明厂商仍然愿意为"最强模型"保留溢价空间,价格战主要在中端市场展开。
- 开放权重模型的真实到手价,取决于你从哪买,而不只是官方牌价:GLM-5.2官方价与第三方托管中位价能差2-5倍,这个现象在闭源模型里不存在——闭源模型的官方价就是价格天花板。
- 思考/推理强度目前主要通过"消耗量"而非"单价"影响账单:除OpenAI(速度分级)和DeepSeek(峰谷电价)外,其余厂商的推理强度开关都不改变token单价本身;Kimi K3和Claude Fable 5甚至强制思考常开、无法关闭。对中转站用户而言,这意味着"每M token单价"这个数字本身可能低估真实支出,真正决定账单的还有"这个模型完成同一个任务平均消耗多少token"。
- 缓存折扣是被低估的省钱杠杆,且厂商间力度差异极大:DeepSeek缓存命中价接近归零(约98%折扣),OpenAI/Google/Kimi K3普遍收敛在90%折扣附近,GLM-5.2约81%,Grok 4.5为75%——对"反复处理同一份长文档/长代码库"的Agent场景,缓存折扣力度可能比"未命中输入价"本身对实际账单的影响更大。
- "预告"与"正式发布"之间的价格信息真空是最容易被误传的地方:Astra(OpenAI)、Gemini 3.5 Pro/Gemini 4(谷歌)、Grok 4.6/4.7(xAI)都处于"名字或规格已知、但定价/上下文/发布日期完全空白"的阶段,任何声称"某中转站已支持XX"或给出具体价格的说法,本文调研范围内均未找到官方来源支撑,应视为不实信息。反例是Qwen3.8-Max——它在本次调研窗口内恰好完成了从"Preview无独立定价"到"正式GA、官方$/M标价"的转变,说明这类"预告期价格真空"通常不会持续太久,一旦转正,第一时间就会有明确的$/M tokens标价出现。
另外值得一提:积分制/订阅制与纯token计价并存的现象,中国厂商更常见——GLM Coding Plan、Kimi会员分档、Qwen Token Plan都是包月订阅与按量API并行的两套体系,且订阅价格无法直接换算成等效的$/M tokens;美国四家(OpenAI/Anthropic/Google/xAI)目前API层面仍以纯token计价为主,包月订阅(ChatGPT Plus/Pro、Claude Pro/Max等)属于消费者产品层,不直接对应开发者API定价,两者不能混为一谈。
十四、数据时效性声明与发布前核实结果
请把这份表当成"2026年8月5日前后的快照",而不是永久不变的定价手册
本文所有价格均为独立联网复核+站内已核实数据交叉印证的结果,标注"未公布/未验证"的地方(Astra全部维度、Gemini 3.5 Pro/Gemini 4全部维度、Grok 4.6/4.7全部维度、Gemini 3.5 Flash具体单价、Anthropic缓存折扣具体比例、DeepSeek V4-Pro峰谷加价的官方生效状态)均为如实呈现调研当下的信息空白或信源冲突状态,不代表"永远不会有数字",而是代表"截至发稿没有可信来源给出"。促销价(如Claude Sonnet 5的$2/$10促销至2026-08-31、GLM Coding Plan Lite档促销价)有明确到期时间,读者在到期后阅读本文需自行核实是否已恢复标准价。中转站/relay相关的具体折扣比例(第十二节引用的TokenRiver"1¥=$1"等站内已发布数字)沿用自站内此前测评内容,本次未逐一重新核实,中转站定价变化频率通常快于底层模型官方定价,建议读者以本站AI API中转站对比看板或厂商最新页面为准。
由于价格随时间变化快,本文发布前专门就本轮调研里最新、最容易过时的两条变化做了独立复核:DeepSeek V4-Pro的峰谷电价——确认截至发稿仍未正式生效,官方定价页仍为单一费率,且加价范围覆盖输入输出全部计费项而不只是output;Qwen3.8-Max的转正定价——确认$2.00/$6.00这组数字准确无误,并且能从"该定价约为Claude Opus 5输入价40%、输出价24%"这个独立角度得到交叉印证,可信度较高。这两条核实结果已经分别写入第五节和第七节的核实框里。
十五、结论:这张表该怎么用
看完这九家厂商的定价全景,一个诚实的结论是:单纯比较"每M token多少钱"这个数字,已经不足以回答"到底哪个模型更划算"这个问题。真正需要放进决策里的至少还有三层:第一层是裸价格本身,开源阵营在这一层有数量级优势;第二层是缓存折扣、长上下文阶梯、峰谷电价、推理强度这些计价机制,它们决定了同一个单价数字背后真实账单可能相差数倍;第三层,也是本站读者最该关心的一层,是"你打算从哪买"——开放权重模型的官方价只是起点,第三方托管竞价可能把价格打到官方价的两三折;闭源模型的官方价则是价格天花板,中转站能提供的只是更便宜的账号额度,而不是更便宜的算力,这也意味着两类中转服务的风险评估逻辑完全不能混用。
合在一起看,这意味着
如果你只是想快速定位一个"够用又便宜"的模型,DeepSeek V4-Flash和Qwen3.6-35B-A3B这类开源轻量档现在是全场价格底线;如果你需要顶尖智能且对预算不敏感,Claude Opus 5、Fable 5和GPT-5.6 Sol仍然是天花板;如果你在意的是长期、大批量的Agent工作流成本,缓存折扣力度和"思考强度是否能关闭"可能比裸单价更值得优先比较。
- 预算敏感、追求性价比的开发者 → 优先看开源阵营(DeepSeek、Qwen、GLM、Kimi、MiniMax),并且认真比较官方价和第三方托管价的差异,别默认官方价就是最低价。
- 需要顶尖智能、预算相对宽松的团队 → Claude Opus 5、Fable 5、GPT-5.6 Sol仍是当前性能天花板,但要留意effort/思考强度开关对实际消耗量的影响。
- 依赖国内中转站接入海外模型的开发者 → 先分清你要接入的是开放权重模型还是闭源模型,这决定了该用"比算力竞价"的逻辑还是"比账号额度折扣与稳定性"的逻辑去评估供应商,具体供应商对比可参考本站AI API中转站对比和OpenAI API中转站推荐页面。