开始测试不需要先充值
AiHubMix(aihubmix.com)的入场方式和大多数中转站不同:注册账号即获得永久免费测试额度,调用 Claude/GPT/Gemini 等主流模型不需要先掏钱。
这个免费层不是时间限制的试用期,也不是仅限于几次演示的配额——它是持续可用的低频调用权限。原型开发阶段,你可以把代码跑通、把接入测完,再决定是否为正式使用充值。
Prompt Caching:这个功能能省多少钱
AiHubMix 是国内中转站中少数明确支持 Anthropic Prompt Caching 的平台。基本原理:
- 将请求前缀中重复出现的内容标记为”可缓存”(添加
cache_control字段) - 第一次写入缓存按正常价计费,命中缓存的后续读取只收 10% 费用
- 缓存有效期约 5 分钟(TTL 内再次调用才命中)
具体省多少? 假设你的 AI 应用每次请求都带 2000 tokens 的系统提示词,每天调用 10000 次:
- 不用 Caching:每天系统提示词成本 = 2000 × 10000 × $5/M = $0.1/天,年 $36.5
- 用 Caching(90%命中率):写入成本 + 读取成本 ≈ 原来的 19%
长对话、RAG 应用、带大量系统提示词的 Agent 受益最大。
# AiHubMix Prompt Caching 接入
import anthropic
client = anthropic.Anthropic(
api_key="你的Key",
base_url="https://api.aihubmix.com"
)
response = client.messages.create(
model="claude-opus-4-8",
max_tokens=1024,
system=[{
"type": "text",
"text": "你是一个专业的代码 reviewer,规范是:...(大段系统提示词)...",
"cache_control": {"type": "ephemeral"} # 标记为可缓存
}],
messages=[{"role": "user", "content": "帮我 review 这段代码"}]
)
价格与定位
免费测试层之外,AiHubMix 按量付费 + 高用量阶梯折扣,不设月费。整体价位中等——不是最便宜的,但免费层 + Prompt Caching 的组合可以在特定场景显著降低实际成本,使其总拥有成本不一定比低价平台更高。
具体价格以官网(aihubmix.com)实时定价为准。当前活动:全场模型(Claude 系列除外)10% 折扣,glm-5.2 每日 14:00–23:59 UTC 最高 50% 限时折扣,qwen3.8-max-preview 限时按标准价 20% 计费。
模型覆盖
覆盖 Claude/GPT/Gemini/Grok/DeepSeek/Qwen/Kimi/GLM/MiniMax/Doubao 等 800+ 模型,含图像/视频生成(qwen-image、doubao-seedance、Kling 等):
- Claude:Fable 5、Opus 4.8、Sonnet 4.6、Haiku 4.5(全线支持 Prompt Caching)
- GPT:GPT-5.5、GPT-4o、o 系列推理模型
- Gemini:Gemini 3.5 Flash/Pro
- DeepSeek:V4 Pro、V4 Flash
同时覆盖图像/视频生成(qwen-image、doubao-seedance、Kling 等),不再局限于纯文本场景。
技术文档
AiHubMix 的文档是其区别于粗糙中转站的重要特征——接入指南、Prompt Caching 使用说明、常见错误处理相对完整。对第一次接 AI API 的团队,有文档的平台明显降低摩擦。
适合与不适合
| 场景 | 说明 |
|---|---|
| 原型开发 / MVP 阶段 | 零成本开始,不用担心测试期费用 |
| 长对话 / 长上下文 Claude | Prompt Caching 节省 90% 重复 token 成本 |
| RAG / AI Agent 产品 | 大型系统提示词命中缓存效果显著 |
| 追求最低单价 | 中等定价,不如 TokenRiver(1¥=$1 官方汇率计费) / yunwu |
| 需要多模态(图像/视频) | 不覆盖 Midjourney / Suno |
| 严格 SLA 要求 | 无公开 SLA 数字,不适合 |
有合规要求需要签署数据处理协议(DPA)的企业场景,建议直接评估 CloseAI 的企业级协议方案,AiHubMix 目前没有公开 DPA 签署流程。
本文信息核实日期:2026-08-11,Prompt Caching 使用前请参阅 aihubmix.com 官方文档,缓存命中率取决于调用频率与 5 分钟 TTL 的匹配程度。
相关推荐
- RunPod:按秒计费GPU云,社区算力池,比AWS便宜70%
- Jina AI API:多模态嵌入+Rerank+Reader全栈,RAG场景低延迟CDN
- RunAPI:高质量高速运行,国内直连,追求速度的开发者之选
- MoleAPI:单一API统接GPT-4o/Claude/Gemini,<50ms直连延迟,OpenAI格式兼容,新用户注册赠免费额度
快速信息卡
| 定价模式 | 免费测试层(低额度永久免费)+ 按量付费阶梯定价;不设月费,高用量按阶梯折扣 |
|---|---|
| 模型覆盖 | Claude/GPT/Gemini/Grok/DeepSeek/Qwen/Kimi/GLM/MiniMax/Doubao 等 800+ 模型(含图像/视频生成,如 qwen-image、doubao-seedance、Kling) |
| 延迟/SLA | 自建加速网络,宣称延迟降低 75%、可用性 99.99%(分钟级探测+自动故障转移);国内直连 |
| 国内直连 | 直连 |
| 适用场景 | 开发者 |
| 邀请/返利计划 | 未发现公开联盟计划,可咨询官方核实。 |
优点
- 永久免费测试层:低频调用无需付费即可测试Claude/GPT/Gemini等主流模型,零成本验证集成效果
- 支持 Anthropic Prompt Caching,可显著降低长对话和重复前缀场景的API成本
- 文档完善,开发者集成体验好,适合技术团队快速接入
缺点
- 中等价位,超出免费层后的正式定价不在最低竞争区间
- 免费层额度有限制,高用量场景需付费升级
- 公开的延迟数字和独立稳定性测评数据较少