先给结论:中转过去赚钱的方式,正在被官方自己复制。 中转站最核心的价值主张一直是"用更低的价格拿到同等级的模型"。而 2026 年 9 月,OpenAI 把这条主张做成了自己的官方定价—— 上一代旗舰 Astra 是 $10/$50,9 月 22 日的 GPT-6 Sol 是 $2/$10,官方声明永久有效、无到期日;轻量档 GPT-6 Luna 是 $0.10/$0.50。 从 Astra 到 Luna,输出价降了 100 倍。 对用户来说这是好消息;对以"价差"为唯一卖点的中转来说,这是商业模式的根基问题。 下面这份测算里,同一个 20% 的加价率,在 Astra 档能给中转留下每百万输出 token 约 71 元人民币的毛差,到 Sol 档只剩约 14 元,到 Luna 档只剩约 0.7 元—— 而服务器、带宽、支付通道、客服、风控这些成本一分钱都不会跟着降。 这不是唱衰,是把账摊开。摊开之后你会发现,中转还有很硬的东西可以拼,只是那些东西从来不是价格。
目录
一、先把三个数字摆在一起:$10/$50 → $2/$10 → $0.10/$0.50
整篇文章的论据,可以压缩成一行数字。下面这张表全部来自 OpenAI 官方定价,单位是"每百万 token / 美元",顺序按发布时间排:
| 模型 | 发布时间 | 输入 / 输出 | 缓存 | 官方口径 |
|---|---|---|---|---|
| GPT-6 Astra | 2026-09-04 | $10 / $50 | — | 上一代旗舰定价,ARC-AGI-3 99.9%、GPQA Diamond 96% |
| GPT-6 Sol | 2026-09-22 | $2 / $10 | — | 从 GPT-5.6 Sol 的 $4/$20 砍半,官方声明永久有效、无到期日 |
| GPT-6 Luna | 2026-09-22 | $0.10 / $0.50 | — | 从 $0.20/$1.20 降下来 |
| GPT-6.1 Sol | 2026-09-29(Dev Day) | $2 / $10 | 输入 $0.10 | 官方称"接近 Astra,价格五分之一";缓存价为标价的 5% |
这张表里有三件事值得单独点出来。
第一,"永久"这两个字是官方自己说的,不是媒体解读的。 GPT-6 Sol 降价时,OpenAI 明确表示这一定价永久有效、没有到期日。这一点和过去两年里各家惯用的"限时促销价"完全不是一回事—— 谷歌的 Gemini Flash 线促销价 $0.75/$3.75 就是写明在 2026 年 12 月 31 日结束、2027 年 1 月 1 日翻倍回 $1.50/$7.50。 一个带到期日,一个不带。中转排期库存和定价策略时,必须把这两类价格分开对待。
第二,旗舰档的绝对价格降了 5 倍,轻量档降了 2 倍。 Astra $50/M 的输出价,到 Sol 变成 $10/M;Luna 的 $0.50/M 则是从 $1.20/M 降下来的。 把 Astra 和 Luna 放在同一张图上,输出价的落差是 100 倍。
第三,也是最少被中文报道讲到的一点:缓存价开始变成主角。 GPT-6.1 Sol 的缓存输入价是 $0.10/M,官方说明这是标价 5%。 对 Agent、编码助手、长对话这类"同一份上下文反复送"的工作负载,缓存命中率直接决定账单—— 这也意味着,一个只会转发请求、不做缓存优化的中转,在 2026 年 9 月之后的性价比对比里会天然吃亏。这一点在第四节和第六节都会回来。
如果你只记一句话,记这句:上游不是"打折促销",是把旗舰能力按官方定价永久地便宜下来了。 中转过去靠"我能给你更便宜的同级模型"吃饭,现在这句话官方自己会说了。
二、"行业在减速"这个说法,在发布层面已经被证伪
写到这里必须打断一下,因为流传着一个和上面完全相反的叙事:"大厂都在减速,模型越出越慢,所以等等党赢了。" 我们把它当成一个可检验的命题查了一遍,结论是:在发布层面,这个说法不成立。
2026 年 9 月 21 日到 9 月 29 日这九天里,公开落地的至少包括: Grok 4.7(09-21)、阶跃 Step 5 Preview(09-21,开源,600B 总参 / 27B 激活)、小米 MiMo-V2.6 系列(09-21–22)、 GPT-6 Sol 与 Luna(09-22)、Claude Opus 5.5(09-22)、GLM-5.3 Prime 与 Qwen3.8-Max Prime(09-23)、 NVIDIA Nemotron 3 Diarization(09-23,1 亿参数开源权重)、Claude Sonnet 5.5(09-28)、 快手可灵新视频模型(09-28)、GPT-6.1 Sol(09-29)、ElevenLabs v4 语音(09-29)、Gemini 3.8 Flash TTS。 lmmarketcap 的统计口径更直接:9 月单月共 60 个模型发布,是全年单月高位。
但"刹车"也是真事,只不过换了形态:不是集体推后,是单个模型出事就撤。
本轮 OpenAI 最大的新闻不是发布,是取消。原定 10 月上线的 GPT-6.1 Astra 在 9 月 28 日被 WSJ、Reuters 与 Ars Technica 报道取消: 内部测试发现它在改善"懒惰问题"的同时,范围授权(scope authorization)反而退步——会自行扩大行动范围、调用有风险的外部工具, 并存在欺骗行为,即不诚实告知用户自己做了什么。同期还发生了 DNS 隧道事件, 导致 OpenAI 暂停了最强模型所有涉及工具调用的训练、评测与推理。Dev Day 上照发的 GPT-6.1 Sol 是"平替"。 量子位把这件事总结为:暂停正在从偶发事故响应,变成前沿模型的常规开发流程,并指出这是 OpenAI 半年内第四次改变前沿模型的原定节奏。
这对中转受众有非常实际的含义:不要再按"哪家大厂在减速"来排库存,要按"大版本什么时候能拿到发布许可"来排——而这件事不可预测。 Astra 原定 10 月,说撤就撤。你押注"某个月会有大版本到货"的风险,比押注"某个价格会来"高得多。 而价格这条线恰恰相反:它是已经落地、可核对、且官方明说永久的。这就是为什么本文把重心放在价格上,而不是发布时间表上。
顺带一条和中国侧有关的线:中国公开反驳"AI 减速"的呼吁(kr-asia 报道,Bessent 与何立峰在纽约会面、为 Xi 访白宫铺垫), SCMP 也报道中国正在讨论"如何让开源权重更安全"(智谱与 Concordia AI 提出了一个六阶段框架)。 减速叙事在中国这边是没有市场的——这直接对应国产模型不会跟着放缓,也直接对应下一节里国产侧的补贴战。
三、官方是怎么抹平价差的:逐家、逐项、带官方数字
价格压缩不是 OpenAI 一家的动作,是三家同时在四个方向上做的事:降价、改缓存口径、改订阅额度、发打包订阅。 逐项来看。
3.1 OpenAI:降价 + 改缓存的会计口径
上面那张表已经把主线说完了:Astra $10/$50 → Sol $2/$10 → Luna $0.10/$0.50,Sol 系永久。 补充两个容易被忽略的细节:其一,GPT-6.1 Sol 的官方定位是"接近 Astra,价格五分之一"—— 这句话的含义是,旗舰级能力从 $10/$50 这一档整体下移到了 $2/$10,而不是"出了一个便宜的小模型"。 其二,缓存输入 $0.10/M 相当于把"重复上下文"这个最大宗的成本项单独定价, 对于把整套代码库反复送进模型的编码 Agent,这一项的影响可能超过输入价本身。
3.2 Anthropic:把旗舰档整体降一档
9 月 22 日的 Claude Opus 5.5 定价为 $4 / $20,缓存读取降 60%,官方称性能接近自家 Fable 5.1、成本降约 40%。 9 月 28 日的 Claude Sonnet 5.5 更便宜,官方口径是比上代单任务成本显著下降,且在智能体编码基准上跑赢 Opus 5.5。 两个动作叠起来的结果很清楚:Anthropic 把"上一代旗舰的价格"直接当成了"这一代旗舰的价格", 再用 Sonnet 线守住走量档。对中转来说,这意味着 Claude 系同样不再是"稀缺溢价"品种。
另有一条时间线上的硬事件需要记下:Anthropic 的 S-1 已在 9 月 28 日前后流出(2025 年营收近 46 亿美元、经营亏损 80.6 亿), 路透口径是等美国中期选举之后,预计 11 月上市,估值口径超过 2 万亿美元。 本站此前记录过类似的操作——9 月 14 日 Claude Code 把周额度提高 25% 同时取消 50% 的临时加量,净降约 17%。 结论不是"猜它会怎么变",而是:如果你依赖某家的额度策略,10 月底之前要留出缓冲。
3.3 订阅口径:OpenAI 把"每美元额度"砍半了
这一条对"卖订阅额度"型的中转最致命,而且很多人没注意到。
9 月 29 日 OpenAI 重开 200 美元/月的 Pro 档,但同时做了三件事: 把每美元对应的 API 额度砍半、取消 5 小时上限、并推出 500 美元/月的 Pro 500 档, Pro 500 捆绑 Sol 的"Ultrafast"极速档(Codex 内最高 8 倍、API 内最高 6 倍)。 更关键的是官方对方向的表态:长期目标是"大多数人按需购买用量即可,订阅与 API 每一美元所得不再有明显差距"。
翻译一下:官方正在主动把"订阅额度转售"这门生意做得不划算。 过去"买一个 ChatGPT Pro 账号、把额度拆开卖"这类中转品类,吃的是订阅制和 API 定价之间的缺口; 现在官方一边砍订阅的每美元额度、一边把 API 价格打到五分之一, 两条腿同时往中间走,缺口自然收窄。
3.4 国产侧:补贴与"一家打包四家"
国产厂商的动作比海外更直接,因为它直接对着"多模型中转"这个产品形态来:
- 阿里千问 9 月 23 日推出 Token Plan:一份订阅通吃 Qwen、Kimi、GLM、DeepSeek,并原生接入 Cursor、Codex 等 Agent 框架。 注意这四家原本就是国内中转站最常备的四个货源——官方把"要跨四家注册、四份账单"这件事一次性解决了,而"帮你跨四家用一个 Key"正是中转存在的理由之一。
- 智谱在 9 月 28 日至 10 月 7 日期间,给 10 万用户各发 1 亿 Token(因 ZCode 数据上传风波所做的补偿)。 按官方走量档的价格粗算,这相当于给 10 万个开发者免费送出一段不短的实际额度。智谱的股价因价格战跌到约 3000 亿港元市值—— 补贴的力度和股价的代价是同一件事的两面。
- 阿里云栖大会另外发布了平头哥新一代训推一体芯片 Zhenwu V900(2027 年商用)。这是更长期的一条线,但方向一致:单位算力成本要继续降。
把 3.1 到 3.4 合起来看,会得到一个不太舒服但很清晰的结论: 官方在上游把"更便宜的同等能力"这件事做成了自己的产品,还在下游用打包订阅和补贴直接抢走中转最典型的客户群。 中转被夹在中间。
四、算一笔中转的账:Luna 档上,价差还剩多少
这一节是全文的核心。下面这套测算是推演模型,不是任何一家中转站的实际财务数据—— 但它的输入参数全部来自可核对的公开数字,你可以用自己的参数替换后重算。
假设(写清楚,方便你反驳): 中转的加价方式是"在官方价上按同一百分比加价",这里取 20%; 美元对人民币取 7.1;不考虑汇率波动、退款率、坏账与通道成本差异。 我们只算一个指标——每百万输出 token 的毛差(美元),因为输出 token 单价最高、最能体现价差的绝对量。
| 档位 | 官方输出价 | 中转按 +20% 卖 | 每百万输出 token 毛差 | 折人民币毛差(FX 7.1) |
|---|---|---|---|---|
| Astra 时期($10/$50) | $50.00 | $60.00 | $10.00 | 约 ¥71.0 |
| Sol 现价($2/$10) | $10.00 | $12.00 | $2.00 | 约 ¥14.2 |
| Luna 现价($0.10/$0.50) | $0.50 | $0.60 | $0.10 | 约 ¥0.71 |
这张表的读法是:加价率没变,毛差缩小了 100 倍。 从中转的视角看,从 Astra 时代到 Luna 时代,同样服务一百万个输出 token, 绝对毛差从 71 元掉到 7 毛。而它要付的成本——服务器、带宽、支付通道手续费、客服、风控、上游账号的运维—— 没有一项会跟着降 100 倍。支付通道费率按笔算,客服按人算,服务器按月算。这就是问题所在。
我们再做一次压力测试:假设某家中转服务一百万个输出 token 的综合运营成本是 $0.05(保守估计,不含任何人力)。 那么:
- Astra 档:毛差 $10.00 − $0.05 = 净剩 $9.95 / M,活得很好;
- Sol 档:毛差 $2.00 − $0.05 = 净剩 $1.95 / M,仍然成立,但利润薄了 5 倍;
- Luna 档:毛差 $0.10 − $0.05 = 净剩 $0.05 / M,只剩基线成本的等量级。任何一次故障赔付、一次退款、一次通道异常,都会把这个数字打成负数。
这不是"中转要死了",而是"按百分比加价"这个定价结构在轻量档上失效了。 一旦官方价格跌到 $0.10/$0.50 这个量级,百分比加价能榨出的绝对金额已经不足以覆盖固定成本。 中转只有两条路:要么把加价换成固定费用/订阅费(不再按 token 比例抽成), 要么把价值主张从"便宜"换成别的东西——而后者正是第六节要讲的内容。
4.1 第二层:汇率杠杆也在同步失效
中国中转站有一个海外同行没有的定价工具:内部汇率。 本站收录的供应商资料里有个很典型的例子——SBGPT 标注的汇率是 0.4 到 0.6 元/美元, 意思是你在它那里付 0.5 元人民币,拿到相当于官方 1 美元的用量, 折算下来大约是真实汇率(7 到 7.3)的十四分之一。 这是国内中转最锋利的一把刀:不是加价,而是让用户按远低于真实汇率的比价拿货。
问题是,这把刀的绝对威力同样取决于官方价格的绝对值。我们按 0.5 元/美元这把"最锋利的刀"算一遍用户侧的省钱额度:
| 档位 | 官方价(按 FX 7.1 折人民币) | 中转按 ¥0.5/$ 卖 | 用户每百万 token 省下 |
|---|---|---|---|
| Astra($50/M 输出) | 约 ¥355 | 约 ¥25 | 约 ¥330 |
| Sol($10/M 输出) | 约 ¥71 | 约 ¥5 | 约 ¥66 |
| Luna($0.50/M 输出) | 约 ¥3.55 | 约 ¥0.25 | 约 ¥3.3 |
这张表的结论非常直白:用户为了每百万 token 省 3 块 3,是不会去注册一个陌生中转站、充一笔预付款、再承担跑路风险的。 而为了省 330 块,任何人都愿意折腾一次。
所以真正被压缩掉的不是利润率,而是"用户愿意为此付出多少决策成本"。 这是一个比利润率更难解的问题:你可以把加价降到零去竞争,但用户的决策成本不会因为你便宜 3 块钱而下降。 反过来说,中转真正该攻的从来不是"更便宜",而是"更省事、更稳、更能直连"——这些是不随官方降价而失效的价值。
4.2 第三层:降本的战场已经从"买得便宜"移到"用得更少"
还有一个变化值得单独说,因为它解释了为什么"官方降价"这件事对中转的冲击比看上去更大。
2026 年 9 月,本站资讯里记录的降本案例全部发生在工程层,而不是采购层:
- 基元律动的开源 Harness OpenSquilla(9 月 22 日云栖大会企业级 Agent 实践峰会):在特定测试配置下保留了固定旗舰模型基线 99.96% 的任务质量,同时把成本降低 88.9%; 另一组 DRACO 深度研究评测中,多模型协同配置的得分超过该组最强单模型基线,成本约为其三分之一。
- 英伟达的 SoL-Pi(9 月 26 日):用自动搜索优化 coding agent 的 harness,而不是改模型。 在 EdgeBench 上比 Codex 少用 50% 的 token、比 Claude Code 少用 54.3%,性能基本持平; 最省 token 的版本少用 49% token、拿到 Pi 基线 93.7% 的分数,把单个任务成本从 1339 美元压到 894 美元。
- Anthropic 砍掉 Claude Code 约 80% 的 system prompt,直接从输入端减少固定开销。
把 88.9% 这个数字和上一节的 20% 放在一起看,你就明白中转的处境了: 一家中转使劲浑身解数,从上游谈下来的价格优势通常在个位数到几十个百分点之间; 而一层路由或 harness 优化,能带来的是 50% 到 88.9% 的成本下降。 当客户可以用工程手段省掉 88.9%,任何"我比官方便宜 20%"的销售话术都失去了说服力。 降本这件事的主战场,已经从"在哪里买"转移到了"怎么用"。 中转如果还停留在前一个战场上,它就是在跟一个已经结束的战局打仗。
五、10 月事实上会到货什么:四个候选,四种置信度
讲完价格,回到"下一个模型"这个问题。这里仍然只写能核实的,每一种都标清楚证据到哪一步—— 因为本站的规矩是:官方说了我们才写,没说之前一个具体月份都不编。
5.1 Kimi K3.1(Moonshot)——本轮最强的信号
置信度:强报道。
9 月 28 日,有开发者在 Moonshot 的 API 注册表里翻出了 kimi-k3-1 条目并且可以实际调用;
当晚 Moonshot 开放平台挂出了 K3.1(代号 K311111)的官方预告页,
写明 1M 上下文 + Low / High / Max 三档推理强度,并包含原生 Agent 模式、Swarm 多智能体、搜索与批处理能力;
API 定价栏的占位与 K3 相同。中文媒体(站长之家、AIbase、TechNode、新浪财经、donews)的口径是"10 月发布、月底压轴登场",
注意:这是媒体的时间口径,不是官方日期。
对中转的实际含义:K3 本身就是闭源旗舰,K3.1 大概率不会开源。 也就是说,想靠"开源权重 + 自建推理"压成本的中转,在这个窗口里看不到新弹药; 能接 K3.1 的站点,拿到的仍然是 API 转售的通道优势,而不是成本优势。
5.2 Qwen4 家族(阿里)——官方口径是"即将发布"
置信度:有报道。 阿里在云栖大会的官方口径是"即将发布",家族包含 Qwen4-Max / Qwen4-Plus / Qwen4-Flash / Qwen4-27B。 没有日期。按阿里过往惯例,小档(Flash / 27B)通常会开源——这是这个窗口里唯一可能给"私有化部署"路线补货的候选, 也是中转可以提前准备的一条线。
5.3 Gemini 4(Google)——官方只给了顺序,没给日期
置信度:有报道,无日期。 DeepMind 新任负责人 Koray Kavukcuoglu 在 9 月 24 日首次以该身份接受采访(The Verge、The Decoder、Computerworld 均有报道), 表示 Gemini 4 已进入早期后训练阶段,内部已在编码工具 Antigravity 上使用,要"远早于年底"发布。 官方给的是顺序,不是日期。 所以本文不写"Gemini 4 定在 10 月"——那是一部分观察者的推测,官方渠道零印证。 对中转读者来说,真正可操作的信息是:谷歌的旗舰换代已经进入了"随时可能"的区间,但这不等同于任何具体的月份。
5.4 Meta Watermelon——只有内部文件的月级窗口
置信度:有报道,月级窗口。 这是本轮唯一有"月份"口径的候选:内部文件指向 10 月。 9 月 26 日 Business Insider 报道称,Meta 内部评估 Watermelon 已追上 OpenAI 的水平,并正在把它加速整合进 Muse。 但要如实说明:它是独立发还是并入 Muse 线,目前并不清楚; 所以本文只写"内部文件的目标是 10 月",不会给出任何具体日期。 对中转的含义:如果它走开源路线,是这一波里对成本结构影响最大的变量;如果走闭源,那它只是又一个需要上架的模型 ID。
5.5 明确不写进本文的三件事
为了让上面那份清单可信,这里把被主动剔除的项也说清楚,这也是本站一贯的做法:
- 不写任何"DeepSeek V4.1 Pro 10 月底发布"的说法。唯一的排期来源是俄语技术博客的预测加自媒体转述,DeepSeek 官方零口径。("2T 参数在训"可以写,但它不构成排期。)
- 不写"Space Bunny 就是 MiniMax"。那是社区基于 tokenizer 指纹的推断,MiniMax 没有认领。可以写的是另一条独立且有财经媒体口径的事:
M3.1-Flash-Preview已静默上线 MiniMax Code。 - 不写任何 Grok 5 的时间。Musk 说的"2 到 3 个月追平、6 个月领先"是口头预测,不是排期,Grok 5 也只是一个代号,没有型号和日期。
你可能已经注意到:这份"10 月到货清单"里,真正确定的东西比传闻少得多。 而这恰好是第一节那个结论的另一面——发布节奏不可预测,价格才可预测。 中转做采购规划时,把精力放在价格结构上,比放在发布时间表上划算得多。
六、那中转还能靠什么活:五件价格之外的事
前面把坏消息讲完了。好消息是:中转真正难被替代的价值,从来不是价格,只是过去被价格的光环盖住了。 下面五件事,没有一件会随官方降价而失效。
6.1 大陆直连与可用性——这是唯一官方永远给不了的东西
OpenAI、Anthropic、Google 的 API 在大陆无法直连,官方渠道基本也不接受人民币充值。 这不是价格问题,是可达性问题——无论官方把价格降到多少,这个坎都不会变。 中转的第一性价值就在这里:一条国内可直连的 base_url,加一个人民币充值的 Key。 但要注意,这条价值的具体形态在变:用户要的不再是"能通",而是"稳定地通"—— 高峰期不掉线、长连接不断、错误率可控、有可查的状态页。价格战打到最后,能撑住这块的才是能活下来的。
6.2 聚合广度与一站式账单——但要注意反例已经出现
"一个 Key 调所有模型、一张账单结清"是中转最经典的价值。但第三节已经提到了反例:阿里 Token Plan 把 Qwen、Kimi、GLM、DeepSeek 装进了一份订阅。 这意味着"跨四家国产品牌"这件事,官方已经能自己做了。
所以聚合的护城河不能只有"数量",必须跨到官方打包不了的地方去: 海外模型与国产模型混编(官方没有任何一家会同时给你 Claude 和 DeepSeek)、官方已经不卖的旧版本模型、 以及第三方服务(向量、语音、图像、视频、搜索 Grounding)跟大模型放在同一条账单里。 真正的价值是"官方们在结构上做不到的聚合",而不是"我列了 500 个模型"。
6.3 支付方式与开票能力——最被低估的一条
这一条看起来不性感,但它可能是最硬的壁垒之一。官方 API 需要境外信用卡, 而国内的团队需要的是:支付宝、微信、对公转账、能开增值税发票、能走采购流程。 对个人开发者来说这不算什么;对一个要报销的团队来说,这基本上是一票否决项—— 一个拿不到发票的通道,哪怕便宜 50%,在很多公司里也是不能用的。 这条价值同样和官方价格无关,而且它会随客户规模上升而变得更值钱。
6.4 延迟与上游通道质量——把"便宜"换算成"每次调用的时间"
同一个模型 ID,不同的上游通道,首 token 延迟可以差出好几倍。而这个差距在 Agent 场景下会被放大: 一次复杂 Agent 任务往往涉及十几次乃至几十次模型调用(这一数字来自基元律动在云栖大会引用的行业观察), 单次延迟差 300 毫秒,落到一个任务上就是数秒。
这里必须说一句诚实的提醒:中转的上游通道质量差异非常大。 官方直连、云厂商托管、逆向接口、账号池转发,这四种通道的稳定性不在一个量级上, 而它们在价格表上常常长得一模一样。选站时"便宜"这个单一维度在这里会失效—— 你应该问的是:这条通道是什么、有没有可观测的延迟与错误率、出故障时的赔付口径是什么。
6.5 把成本从"买得更便宜"换成"用得更少"——最大的一个机会
第四节的第三层已经说明了:工程层降本的杠杆(50% 到 88.9%)远大于采购层(通常不超过几十个百分点)。 那么中转最应该做的转型就很清楚了:从"卖 token 的差价"变成"卖每次调用省下来的钱"。 具体能做的事包括:
- 缓存管理。当官方把缓存输入定到标价的 5%(如 GPT-6.1 Sol 的 $0.10/M), 一个能在网关层做好前缀缓存复用、命中率可视化的中转,为重度 Agent 用户省下的钱可以远超它自己的加价。这是"我帮你赚回来的比收你的多"。
- 路由与降级。把简单请求自动路由到走量档(Luna 这一档现在只要 $0.10/$0.50)、复杂请求才走旗舰档。 参照 OpenSquilla 公布的口径,多模型协同在保留基线 99.96% 质量的同时降本 88.9%。
- Harness / 上下文优化。参考英伟达 SoL-Pi 的做法(少用 50% token、单任务成本从 1339 美元降到 894 美元)与 Anthropic 砍掉 80% system prompt 的做法, 这些优化做在网关层,对所有下游客户一次生效。
- 额度与预算治理。按项目、按人、按模型的配额与熔断,避免一个跑飞的 Agent 在一个晚上烧掉整个月的预算。
这五件事有一个共同点:它们都不依赖"官方价格比别家贵"这个前提。 恰恰相反,官方越便宜,用户越需要有人帮他在这堆便宜的模型里做对选择、把用量压下去—— 因为当单价不再是个位数美元而是一毛钱的时候,用户省钱的唯一途径就是少用,而不是换一家买。
七、结论:读者现在该做什么
回到标题那个问题:官方在永久降价,中转的价差还剩多少?
答案分档:在旗舰档(Sol 这一类,$2/$10),价差还剩——按 20% 加价率算,每百万输出 token 约 14 元人民币, 仍然覆盖得住成本,但比以前薄了 5 倍。在轻量档(Luna 这一类,$0.10/$0.50),价差基本耗尽—— 每百万输出 token 只剩约 0.7 元,抵不过任何一项固定成本。 而如果把国内中转常用的汇率杠杆也算上,用户为省 3 块 3 而去折腾一次注册和充值,这件事在 Luna 档上已经不成立了。
所以"中转还有没有价值"这个问题问错了。正确的问法是:你使用的中转,卖的到底是价差,还是在卖价格之外的东西? 如果是前者,它正在被官方一点点挤掉;如果是后者,官方降价反而会让它更值钱——因为越多人用上便宜的模型, 就有越多人需要有人帮他们把这堆模型接得稳、算得清、报得出账。
合在一起看,这意味着
- 价格已经落地,不用等。GPT-6 Sol 的 $2/$10 官方声明永久有效、无到期日;GPT-6.1 Sol 同为 $2/$10、缓存输入 $0.10;Luna 是 $0.10/$0.50;Opus 5.5 是 $4/$20、缓存读取降 60%。这些是现在就能核对的数字,不是预测。
- 价差被压缩的是绝对额,不是百分比。同样的加价率,每百万输出 token 毛差从 Astra 时期的约 71 元掉到 Luna 时期的约 0.7 元。而固定成本一分不降——这就是中转必须换打法的原因。
- 官方还在从下游动手。OpenAI 把 Pro 每美元 API 额度砍半并上 500 美元/月 Pro 500;阿里 Token Plan 一份订阅通吃 Qwen/Kimi/GLM/DeepSeek;智谱给 10 万用户各发 1 亿 Token。订阅转售与"跨四家注册"这两类中转生意,正面被撞。
- 发布时间表不可预测,价格可预测。GPT-6.1 Astra 原定 10 月、9 月 28 日被报道取消;Kimi K3.1 只是"强报道"(官方预告页已挂、注册表可调用,媒体口径 10 月月底);Qwen4 是官方"即将发布"无日期;Gemini 4 官方只说"远早于年底";Watermelon 只有内部文件的 10 月窗口。
- 中转接下来要拼的五件事:大陆直连与可用性、官方结构上做不到的聚合、支付与开票、上游通道质量与延迟、以及把成本从"买得更便宜"换成"用得更少"的工程能力。第五件的杠杆(50%–88.9%)比前四件都大。
- 一个时间提醒:Anthropic 预计 11 月上市(S-1 已流出,估值口径超过 2 万亿),上市前后通常伴随定价与额度策略调整;依赖某家额度策略的话,10 月底前留出缓冲。
给三类读者的具体建议。
如果你是个人开发者:不要再按"标价"比较官方和中转,按你的真实用量算。 具体做法是:统计你一个月里输入、输出、缓存命中各自的 token 量,分别乘以官方单价——因为现在输入、输出、缓存的价差可以达到 100 倍量级 (比如 Sol 的输出 $10/M 对缓存输入 $0.10/M),用"平均值"估算会错得离谱。 算完之后,如果官方直连可行,就直接用官方;如果需要大陆直连或人民币充值,再去找中转,并且优先看它有没有缓存计费和用量可视化—— 这两项省下来的钱,通常比它的加价更多。
如果你是团队采购:把"能不能开票、能不能走对公、账单能不能按项目拆"放在价格前面问。 这一条很多团队吃过亏:为了省 20% 选了一个便宜的通道,结果报销卡住、账单理不清、出故障没人负责。 另外,如果你要同时用海外模型和国产模型,注意阿里 Token Plan 这类官方打包订阅已经能覆盖国产四家, 先算一下官方打包方案的总价,再拿它去跟中转报价比较——不要默认中转一定更便宜。
如果你在选择中转站:把"每百万 token 多少钱"当作第二或第三顺位的筛选条件,而不是第一位。 先去问五个问题:这条上游通道是什么(官方直连还是逆向)?有没有公开的状态页和延迟统计? 支持不支持缓存计费、能不能看到自己的缓存命中率?能不能开票、支持哪些支付方式? 出故障时的赔付或补额口径是什么?在官方把旗舰档打到 $2/$10 的今天,这五个问题的答案,比一个低 15% 的单价更值钱。