前Meta研究员的创业选择
Lepton AI(lepton.ai)由前Meta AI研究团队成员创立。这个背景不只是PR噱头,它意味着团队对开源大模型的工程化有第一手经验——他们参与过Llama系列的开发,知道如何高效运行这些模型。
Lepton AI要解决的问题是:开发者想用开源大模型,但自己架GPU集群太麻烦,怎么办。
答案是:让Lepton AI管理基础设施,开发者只关心API调用。
极简部署:几行代码起飞
Lepton AI的核心产品是让开源模型的部署和调用变得极简。接入Llama 4的方式:
from openai import OpenAI
client = OpenAI(
api_key="你的Lepton AI Key",
base_url="https://llama4-maverick-instruct-8b.lepton.run/api/v1/"
)
response = client.chat.completions.create(
model="llama4-maverick-instruct-8b",
messages=[
{"role": "user", "content": "解释量子纠缠的基本原理"}
],
max_tokens=512,
stream=True
)
Lepton AI的端点格式是模型名称作为子域名,每个模型有独立的推理端点。
Serverless推理的经济逻辑
自建GPU集群的问题:你需要为最高峰值容量买单,但大多数时间集群是空载的。
Lepton AI的Serverless推理解决了这个问题:
- 没有调用时不产生费用
- 有调用时自动分配GPU资源
- 峰值流量时自动扩展
对于调用量不均匀的应用(白天活跃,晚上几乎没流量),Serverless的总成本可以是固定GPU租赁的1/5到1/10。
自定义模型部署
Lepton AI不只是公共模型的API网关,它也支持用户把自己微调过的模型部署到Lepton AI的基础设施上:
- 上传微调模型权重
- Lepton AI自动容器化并部署
- 获得私有API端点
对于做了领域微调(法律、医疗、金融)但不想自建推理服务器的团队,这是一个实用的选项。
开源模型的适用场景
Lepton AI主要覆盖开源模型,适合:
- 需要完全控制数据的场景(开源模型可以在你的私有环境运行)
- 需要定制/微调模型的应用
- 成本敏感、可以接受开源模型能力范围的项目
对于需要Claude Fable 5或GPT-5.5闭源模型的场景,Lepton AI不是选择。可以看DeepInfra的开源模型低价接入或Together AI的开源推理生态做横向对比。
本文信息核实日期:2026-07-04,Lepton AI模型列表持续更新,请以lepton.ai官方文档为准。
相关推荐
- Requesty:EU友好,400+模型,GDPR合规,20ms故障转移
- Novita AI:200+开源模型,图像生成专项,低价全球推理
- FlowBar:国产+全球双覆盖,36+模型路由,新用户$5体验额度,USD按量付费,生产级可靠性
- AiGoCode:逆向Claude低价,¥2/10M token,月度套餐可选
快速信息卡
| 定价模式 | 按计算用量计费,开源模型低价推理;无月费,serverless按调用付费 |
|---|---|
| 模型覆盖 | 开源大模型主力:Llama 4系列、Mistral、DeepSeek,企业定制部署 |
| 延迟/SLA | 全球节点,低延迟;Serverless自动扩容 |
| 国内直连 | 需代理 |
| 适用场景 | 开发者 / 企业 |
| 邀请/返利计划 | Lepton AI暂无公开联盟计划。 |
优点
- Meta系团队:创始人来自Meta AI研究,深厚的开源大模型工程经验
- 极简部署:几行代码把开源模型部署成API,无需管理GPU基础设施
- Serverless弹性:按调用量自动扩缩容,不用为低峰期的空闲GPU资源付钱
缺点
- 国内需代理访问,不适合国内生产直连
- 主打开源模型,Claude/GPT等闭源模型不在覆盖范围
- 企业大规模定制需求建议直接联系,费用可能超出预期