为什么需要LLM路由
2024年以前,选AI模型是个一次性决策:确定用GPT-4还是Claude,然后把这个选择硬编码到代码里。
这种方式的问题是:不同请求的复杂度差异巨大。“把这段话翻译成英文”和”从这50页财报里提取所有风险因素并分析相关性”,对模型能力的需求完全不同,用同一个模型处理所有请求要么浪费了简单任务的成本,要么在复杂任务上表现不足。
Martian的核心产品是解决这个问题:把模型选择本身变成一个动态决策。
Martian的路由逻辑
Martian分析每个传入请求的特征——任务类型、复杂度、需要的推理深度——然后从它聚合的模型池中选择成本×质量最优的选项。
这背后有几个关键判断:
复杂度评估:Martian需要在不运行模型的情况下预估请求难度。这本身就是一个预测问题,Martian用专门的分类器处理这个环节。
成本×质量的帕累托前沿:在所有可用模型中,Martian的目标是找到当前请求的帕累托最优选择——没有另一个模型能在同等成本下提供更好的质量,或在同等质量下提供更低的成本。
实时可用性感知:如果某个模型当前延迟异常高或出现故障,Martian会自动路由到下一个最优选项。
生产环境中的实际效果
Martian主要面向企业级客户。典型的使用场景是:一个AI应用每天处理数十万次请求,请求类型混合(有简单的意图分类,也有复杂的文档分析),之前统一用一个昂贵的旗舰模型。
接入Martian后,Martian把简单请求分流到轻量模型,只把确实需要旗舰模型能力的请求路由到高端模型,整体成本降低,而质量敏感请求的表现不变。
适合的使用场景
| 场景 | 是否适合 |
|---|---|
| 请求类型多样的AI产品 | 非常适合 |
| 追求最低成本的高并发场景 | 适合 |
| 需要强制指定特定模型版本 | 不适合 |
| 国内直连(无代理) | 不适合 |
| 初创团队/个人项目 | 偏贵,可考虑更简单方案 |
对比其他路由方案
Martian是商业LLM路由的先驱,但现在也有其他路由层产品。主要差异在于:Martian的路由决策逻辑是它的核心商业壁垒,不开源,也不透明公开路由规则。这对某些对路由逻辑有审计要求的企业是一个考量点。
相关推荐
- Unity2.ai:每日30亿Token+处理量,企业高并发中转首选
- 硅基流动 SiliconFlow:国产开源大模型云服务,DeepSeek/Qwen/GLM 等 100+ 模型,自研推理引擎+国产芯片适配
- 简易API:顾名思义主打简单,全模型覆盖,低门槛入门
- AI21 Labs API:Jamba混合架构,长上下文低成本,企业NLP专项
快速信息卡
| 定价模式 | 按路由调用量计费;自动选择最优模型;信用卡支付;具体定价见官网 |
|---|---|
| 模型覆盖 | 通过路由层聚合多家主流LLM,用户无需指定单一模型 |
| 延迟/SLA | 动态路由优化延迟,生产级SLA |
| 国内直连 | 需代理 |
| 适用场景 | 开发者 / 企业 |
| 邀请/返利计划 | 暂未发现公开联盟计划。 |
优点
- LLM路由先驱:Martian是最早将成本×质量权衡引入商业产品的公司之一,在这个领域有深厚的技术积累
- 动态路由降低成本:Martian不固定使用某一个模型,而是根据请求复杂度自动选择性价比最优的模型
- 生产环境验证:Martian的客户群以企业为主,经过了高并发、长期运行场景的实际验证
缺点
- 需要代理访问,国内直连受限
- 价格透明度较低,路由层的实际成本需要通过实测了解
- 对路由决策没有完全控制权,特定场景可能需要强制使用某个模型