Not Diamond:让机器决定用哪个模型
你有没有遇到过这种纠结:同一个应用里,写代码用Claude更好,写营销文案用GPT更好,快速翻译用DeepSeek Flash更便宜,复杂推理用Opus才够——但你不想把这套逻辑硬编码进代码里,因为模型能力排名每个月都在变。
Not Diamond(notdiamond.ai)的答案是:让模型替你做这个选择。
Not Diamond是一个智能路由层,根据每个请求的特征(任务类型、复杂度、语言、长度等),自动选择最适合的模型——目标是在给定成本预算下最大化输出质量,或者在给定质量下最小化成本。
路由逻辑是怎么工作的
Not Diamond通过大量Benchmark数据训练了一个路由模型:
- 接收你的请求
- 分类任务类型(代码/写作/推理/翻译等)
- 评估复杂度
- 查询各模型在该任务类型上的当前性能排名
- 根据你设置的成本/质量偏好,选择最优模型
- 转发请求,返回结果
路由延迟<10ms,对总延迟影响可忽略不计。
接入示例
from notdiamond import NotDiamond
client = NotDiamond(api_key="你的Not Diamond API Key")
session_id, provider, model = client.chat.completions.model_select(
messages=[
{"role": "system", "content": "你是一个专业的代码审查工程师"},
{"role": "user", "content": "帮我review这段TypeScript代码的性能问题"}
],
model=["openai/gpt-5.5", "anthropic/claude-fable-5", "google/gemini-3.5-flash"],
tradeoff="cost" # 或 "quality"
)
print(f"Not Diamond 选择了: {provider}/{model}")
# 然后用选定的模型发真实请求
也支持OpenAI兼容格式直接透传。
什么时候引入Not Diamond
适合引入的场景:
- 应用流量大,不同请求质量需求差异显著,路由能省下明显成本
- 不想维护手工路由规则,随模型迭代自动更新
- 需要基准测试——Not Diamond的选择结果本身就是各模型性能的实时参考
不适合引入的场景:
- 流量低,路由本身成本(时间+钱)不划算
- 对特定模型有强制要求(合规/数据协议)
- 国内用户,代理是前提
同类路由工具还有Unify AI,对比时可以两者都测一下路由准确率。
本文信息核实日期:2026-07-04,路由模型持续更新,以notdiamond.ai官方Benchmark数据为准。
相关推荐
- 接口AI:全模型覆盖,接口设计简洁,30秒快速集成,国内直连
- RunPod:按秒计费GPU云,社区算力池,比AWS便宜70%
- Together AI:大规模开源模型算力聚合,100+模型一个API,科研与企业均适用
- Inworld Router:200+模型0%加价,游戏娱乐AI场景深度优化,智能请求复杂度路由
快速信息卡
| 定价模式 | 按路由请求计费,加价率约5-10%;免费层用于评估;企业定制方案 |
|---|---|
| 模型覆盖 | 路由层,接入OpenAI/Anthropic/Google/Mistral等主流提供商 |
| 延迟/SLA | 路由延迟<10ms,加在上游延迟之上 |
| 国内直连 | 需代理 |
| 适用场景 | 开发者 / 企业 |
| 邀请/返利计划 | 暂未发现公开联盟计划 |
优点
- 智能路由达到SOTA级别:根据任务类型自动选最优模型,保证质量同时降低成本
- 路由延迟<10ms:几乎不增加端到端延迟
- 可自定义路由策略:设定成本上限、质量下限、指定模型黑名单
缺点
- 引入额外供应商依赖:路由层挂了,所有请求都挂
- 国内无法直连,代理是前提
- 在非标准任务上路由准确性有待验证,需要实测