如果只看一个数字,看这个就够了:在第三方评测机构Artificial Analysis的智能指数榜单上,Muse Spark 1.2达到同等"智能水平"所需要的成本是每个任务0.40美元——同一档位的Kimi K3(max档)要花0.86美元,GPT-5.5(xhigh档)要花1.18美元,只有Grok 4.5(high档,0.37美元)和GPT-5.6 Sol(medium档,0.39美元)比它更便宜。这是Meta"超级智能实验室"(MSL)在短短四个月里交出的第三款模型,先说清楚它是什么:Muse Spark不是图片或视频生成模型,而是一个面向多模态推理和编程Agent场景的大语言模型,8月5日这次1.2版本更新,主角是编程能力,同台发布的还有Meta第一款终端编程Agent工具Muse Code。

这篇文章会依次讲清楚:Muse Spark到底是什么类型的模型(先排除掉"是不是图片/视频生成模型"这个常见误解)、从4月8日1.0版到8月5日1.2版的完整版本简史、这次测评要重点展开的四个真实亮点(跑分性价比、Muse Code的常驻后台Agent架构、跑分曲线本身的进步幅度、原生多模态与100万token上下文)、必须正视的短板(官方跑分和独立测试的落差、闭源不可自托管、Muse Code还没有Windows/IDE支持、"贡献者"低价档的隐私代价)、一张横向对比表,以及——对本站读者最实际的问题——国内AI API中转站现在能不能用。所有数据交叉核实自Meta官方研究博客、Artificial Analysis、Vals AI、OpenRouter、VentureBeat、MarkTechPost、TechCrunch、TechTimes等信源;凡是不同信源存在分歧、或者本身缺乏第三方验证的说法,本文都会明确标注,不会为了让测评显得更"完整"而抹平这些差异。

一、Muse Spark是什么:先排除一个常见误解

先把最基础的问题说清楚,因为"Muse"这个名字很容易让人联想到图片或视频生成工具——但Muse Spark不是这类模型。它是Meta旗下"超级智能实验室"(Meta Superintelligence Labs,简称MSL)打造的一个多模态推理大语言模型,主打场景是复杂推理、Agent工作流和软件开发,本质上和OpenAI的GPT系列、Anthropic的Claude系列、月之暗面的Kimi系列是同一类竞品,而不是Midjourney、Sora那类生成式视觉模型。

MSL本身的来龙去脉值得交代一句:据TechCrunch、Silicon Republic等多家媒体报道,Meta在2025年年中以约140亿美元投资AI数据标注公司Scale AI,并招揽其CEO Alexandr Wang出任Meta首席AI官(Chief AI Officer),组建了MSL这个新部门——背景是Mark Zuckerberg对Meta自家Llama系列模型落后于OpenAI、Anthropic的进展感到不满。Muse Spark是MSL成立后交出的第一个模型家族,被官方描述为对Meta整套AI技术栈的"从零重建"(ground-up overhaul)。Zuckerberg将其定位为迈向"个人超级智能"(personal superintelligence)愿景的第一步。这里还有一个值得记录的策略转向:Llama系列一直以开放权重著称,但Muse Spark从1.0版本开始就是彻底的闭源模型——不提供Hugging Face下载,不能自行部署,不支持微调,这是Meta在开放策略上的一次明确掉头,下文会再展开讲这一点的利弊。

具体到本文的主角Muse Spark 1.2:它支持文本、图片、视频、音频、PDF文档作为输入,输出为文本,上下文窗口达到1,048,576 token(约100万token)。8月5日与它同台发布的Muse Code,是Meta第一款终端编程Agent工具,专门为"长程软件工程任务"设计——这也是为什么1.2版本的更新重点几乎全部集中在编程和Agent能力上,而不是泛化的对话体验。

二、版本简史:从4月"推倒重来"到8月5日的1.2版

把时间线理清楚有助于理解这次发布的分量。2026年4月8日,Muse Spark 1.0首次亮相,是MSL的第一个产品,也是Meta从开放权重转向闭源商用API的标志性节点。2026年7月9日,Muse Spark 1.1上线,正式开放Meta Model API的付费访问——据TechTimes报道,这次开放的定价约为Anthropic、OpenAI同期同档模型的四分之一,同时1.1版本在一项独立编程基准测试上拿到71分,成本仅为对手模型的三分之一左右,这也是Muse Spark早期建立起"高性价比"口碑的起点。不过需要说明的是,1.1版本首次开放API时仅面向美国地区开发者,还没有做到全球开放。

2026年8月5日,Muse Spark 1.2正式发布,同时带来了Meta第一款终端编程Agent工具Muse Code(目前是Beta测试阶段)。这已经是MSL四个月内交出的第三款模型——从1.0到1.1间隔约3个月,从1.1到1.2间隔不到1个月,迭代节奏明显在加快,这本身就是一个值得记录的竞争信号:说明Meta把编程Agent这条赛道当成了当前阶段的优先级重点,正在用比行业平均更密集的发布频率去追赶Anthropic、OpenAI和月之暗面。

三、亮点一:跑分性价比——同一智能档位里最会省钱的选手之一

这是Muse Spark 1.2目前最站得住脚的亮点。据Artificial Analysis公布的数据,Muse Spark 1.2在其智能指数(Intelligence Index)上得分54,相比1.1版本的51分、1.0版本的43分,四个月内稳步爬升了11分。放进同一梯队看:GPT-5.5(xhigh档)为55分,Grok 4.5为54分,两者与Muse Spark 1.2基本处于同一水平;再往上是当前头部集群——Claude Opus 5(61分)、Claude Fable 5(60分)、GPT-5.6 Sol(59分)、Kimi K3(57分)。也就是说,Muse Spark 1.2目前的绝对智能水平还没有进入第一梯队,但已经紧贴着GPT-5.5、Grok 4.5这一档,和顶级闭源旗舰之间的差距正在缩小。

真正让它值得单独拎出来说的是"每单位智能"的成本。Artificial Analysis给出的按其官方定价计算的每任务成本是:Muse Spark 1.2约0.40美元,GPT-5.6 Terra(max档)0.51美元,Kimi K3(max档)0.86美元,GPT-5.5(xhigh档)1.18美元;在整个同智能档位集群里,只有Grok 4.5(high档,0.37美元)和GPT-5.6 Sol(medium档,0.39美元)比它更便宜。换句话说,如果你的评价标准是"花每一分钱能买到多少智能",Muse Spark 1.2目前是市面上排在最前面的少数几个选项之一,而不是靠营销话术堆出来的"便宜"印象。

官方API定价本身也印证了这一点:标准档为每百万输入token 1.25美元、每百万输出token 4.25美元,缓存命中输入价格低至每百万token 0.15美元,配合100万token的上下文窗口。这个价位相比Anthropic、OpenAI的旗舰档模型仍有明显优势,延续了1.1版本"约为对手四分之一价格"的定位。

四、亮点二:Muse Code的架构设计——常驻后台Agent+隔离Git worktree并行子Agent

如果说定价是Muse Spark 1.2最容易量化的亮点,那Muse Code的架构设计则是最值得工程师认真看一眼的亮点——这不是一次简单的"套壳"式CLI工具,而是有几个真正区别于同类产品的设计选择。据Meta官方博客和VentureBeat的报道,Muse Code是一款为"长程软件工程任务"打造的终端编程Agent,能够规划、实现并验证跨越大型代码库的复杂多文件改动。

它最核心的设计是持久化的异步后台观察Agent(persistent async background agents):官方描述中提到有四个后台观察Agent会在整个会话期间保持存活,而不是像大多数同类工具那样每个任务临时创建一个子Agent、任务结束就销毁。这意味着这些后台Agent可以持续执行下一步操作、避免重复的信息收集,并自主判断什么时候需要向主Agent汇报——这是一个真实的架构差异,而不是营销包装:大多数编程Agent工具在处理长任务时,每次新起一个子任务都要重新扫描代码库、重新建立上下文,Muse Code这套"会话级常驻"设计理论上能省掉相当一部分冗余的信息收集开销。

针对特别大的任务,Muse Code还支持把工作拆分给多个并行子Agent,每个子Agent运行在自己独立隔离的Git worktree里,上限大致是"CPU核心数减2"。据报道,在一次测试中,这套机制同时为一个游戏项目并行构建了六个功能模块,没有出现任何代码冲突。此外,Muse Code还配备了本地事件日志(local event log),支持"精确重放、断点续跑"(replay-exact, restart-safe)的运行方式,并提供了/plan/grill/goal等命令帮助开发者控制Agent的规划和执行流程。

把这套设计放进整个编程Agent赛道里对比会更清楚:Claude Code的差异化优势更多体现在多端生态——终端CLI、VS Code/Cursor插件、JetBrains插件、桌面应用、网页版、可以用手机远程操控本地会话的Remote Control,以及能桥接Telegram、Discord、iMessage的Channels功能,还有支持云端常驻定时任务的Routines。Muse Code目前完全没有这些多端能力,但它在"单一会话内如何组织多个Agent协作"这个具体问题上,给出了一个和Claude Code、Codex CLI都不完全一样的答案,这是它现阶段最值得关注的技术亮点,而不是简单的"抄一个终端工具"。

五、亮点三:跑分曲线本身——三个月连跳两级,逼近Claude Opus 5

单看Meta自己公布的跑分曲线,进步幅度确实可观。在Terminal-Bench 2.1上,Meta给出的数字是1.1版本76.2分,1.2版本提升到82.9分;在DeepSWE v1.1基准上,1.1版本53.0分,1.2版本提升到59.3分。Meta自己的发布图表把Muse Spark 1.2定位为"仅次于Claude Opus 5"的第二名——在Terminal-Bench 2.1、DeepSWE v1.1和Meta内部编程基准这三项上都是如此。具体到Terminal-Bench 2.1这一项,Meta给出的横向对比是:Claude Opus 5为86.7分,Muse Spark 1.2为82.9分,GPT-5.6 Terra(搭配Codex)为81.8分,Grok Build为81.6分——如果这组数字成立,Muse Spark 1.2确实排在了GPT-5.6 Terra/Codex和Grok Build前面。作为参照,目前所有模型在Terminal-Bench 2.1上被独立验证过的最高分,是Claude Fable 5搭配Claude Code跑出的83.8分。

DeepSWE v1.1上的对比同样值得记录:Muse Spark 1.2为59.3分,Claude Opus 5为65.0分,OpenAI Codex为64.8分——这项基准上Muse Spark 1.2和头部两者之间还有5-6分左右的差距,不像Terminal-Bench 2.1那样接近。把这两项基准放在一起看,比较合理的结论是:Muse Spark 1.2在四个月内实现了两级跳跃式的进步,已经能在部分编程基准上排进第一梯队附近,但"仅次于Claude Opus 5"这个定位目前主要来自Meta自己的发布图表,是否站得住脚,需要放到下一节的独立验证数据里再校准一次。

六、亮点四:原生多模态+100万token上下文,且已经能直接调用

Muse Spark 1.2的另一个实打实的亮点是它的输入形态和接入方式都足够开放,不是一个还停留在"内部演示"阶段的模型。它原生支持文本、图片、视频、音频、PDF文档作为输入,配合100万(1,048,576)token的上下文窗口,理论上可以一次性处理长文档、长视频片段或者大型代码库的相当一部分内容。

接入方式上,Meta Model API采用兼容OpenAI SDK风格的调用方式(基础地址为api.meta.ai/v1),同时文档化支持Chat Completions、Responses以及Messages三种协议格式——这意味着已经在用OpenAI格式或者Anthropic Messages格式接入其他模型的开发者,理论上不需要额外写一层协议转换代码就能把Muse Spark接进现有工具链,这一点和DeepSeek V4系列此前为了适配Codex而原生支持Responses API是同样的思路。除了Meta Model API之外,Muse Spark 1.1和1.2都已经上线OpenRouter,据OpenRouter官方说法,1.2版本发布时同步"扩大了全球访问范围"——相比1.1版本发布时仅限美国地区开发者使用,这是一个明确的开放动作,虽然具体覆盖到哪些国家和地区,目前公开信息里没有给出详细清单,下文谈中转站接入时会再具体说明这一点的不确定性。

七、必须泼的一盆冷水:官方跑分和独立测试的落差有多大

Meta自报的跑分,目前还没有一个是被独立验证过的

上一节提到的82.9分(Terminal-Bench 2.1)和59.3分(DeepSWE v1.1),截至本文发稿,均只是Meta自己发布博客里给出的数字,还没有出现在官方验证榜单上。而1.1版本的历史记录已经说明,Meta自报的分数和独立复现出来的分数之间,落差可以相当明显。

具体到1.1版本这个可以交叉验证的案例:Meta发布1.1时给出的Terminal-Bench 2.1自报分数是80.0分;而Terminal-Bench官方验证榜单给出的复现分数是76.2分(±1.2),即使取误差区间上限77.4分,也比Meta自报的数字低了2.6分;独立评测机构Vals AI用自己的测试框架又单独跑了一遍,测出来的分数是69.29分——和Meta自报的80.0分相比,落差超过10分。这三个数字(80.0、76.2、69.29)来自三套不同的测量方式,本身就说明"跑分"这件事在编程Agent这个赛道里高度依赖具体的测试框架和评测协议,同一个模型换一套测试环境,分数完全可能有实质性出入。

到了1.2版本,情况类似:Meta自报82.9分,但截至本文发稿还没有出现在官方验证榜单上;据Vals AI的独立测试,Muse Spark 1.2在"通用测试框架"(common-harness)的Terminal-Bench排名里只排在第14位,但在Vals自己综合智能水平和成本效率算出来的Vals Index综合排名里排到了第5位,单次测试成本低至0.69美元。这组数据组合起来传递的信息是:Muse Spark 1.2的原始编程准确率,按独立测试机构自己的测试框架衡量,大概率排不进第一梯队;但因为它的成本足够低,把"准确率"和"花费"放在一起综合计算之后,性价比排名会明显靠前。这也是为什么本文在"亮点"部分反复强调的是"跑分性价比"而不是"跑分绝对值"——这是基于目前能查到的独立数据,最诚实的描述方式。

八、其他短板:闭源、Muse Code还不成熟、"贡献者"定价的隐私代价

除了跑分口径的分歧,Muse Spark 1.2和Muse Code还有几个值得写进测评的实际短板,如果只讲亮点不讲这些,测评就不完整了:

  • 彻底闭源,无法自托管:延续自1.0版本的策略转向,Muse Spark系列没有Hugging Face权重下载,不支持自行部署,也不支持微调——这是Meta从Llama时代"开放权重旗舰"的定位上一次明确的掉头。对比本站此前测评过的DeepSeek V4系列、Kimi K3、GLM-5.2等开源权重模型,需要私有化部署、数据不出内网的企业场景,目前完全无法选择Muse Spark。
  • 架构和参数规模完全不公开:Meta没有公布Muse Spark的具体架构(是否为MoE)、参数量或者知识截止日期,属于彻底的黑箱模型,这一点和DeepSeek、Kimi等会公布技术论文和架构细节的厂商形成明显反差。
  • Muse Code目前只是Beta,且缺少关键平台/生态支持:发布时仅支持macOS和Linux,没有Windows版本;也没有VS Code、JetBrains、Neovim这类IDE插件,纯粹是一个终端命令行工具,不具备Claude Code那种多端(IDE插件、桌面应用、网页版、远程操控、消息平台桥接)生态。
  • "贡献者"低价档背后的隐私代价:Meta Model API提供了一档更便宜的muse-spark-1.2-contributor定价(每百万token输入0.10美元、输出0.20美元),但代价是用户同意让Meta使用这些请求和返回内容去训练未来的模型,同时这一档还有每分钟60次请求的速率上限。多篇独立评测都指出,这个定价档位对大多数专业开发场景或者企业级代码库来说并不合适——一旦涉及不希望被用作训练数据的私有代码或业务逻辑,就不应该选择这一档,应该老老实实用标准定价档。

九、横向对比:把Muse Spark 1.2和当红模型放进同一张表

以下两张表分别汇总了智能指数/成本效率,以及Terminal-Bench 2.1这项具体编程基准的横向对比,数字均来自Artificial Analysis和相关厂商发布信息,部分Terminal-Bench分数来自Meta自己的发布图表(已在表格备注中标出,未经独立验证):

模型AA智能指数每任务成本(按对应最高档定价)
Claude Opus 561暂无可信数据
Claude Fable 560暂无可信数据
GPT-5.6 Sol(medium档)59$0.39
Kimi K3(max档)57$0.86
GPT-5.5(xhigh档)55$1.18
Muse Spark 1.254$0.40
Grok 4.5(high档)54$0.37
模型Terminal-Bench 2.1数据来源/验证状态
Claude Fable 5(Claude Code)83.8%目前已知的最高独立验证分数
Claude Opus 586.7%Meta发布图表引用,未标注独立验证状态
Muse Spark 1.282.9%Meta自报,截至发稿未上官方验证榜单
GPT-5.6 Terra(Codex)81.8%Meta发布图表引用
Grok Build81.6%Meta发布图表引用
Muse Spark 1.1(独立复现)76.2%(±1.2)Terminal-Bench官方验证榜单
Muse Spark 1.1(Vals AI独立测试)69.29%Vals AI自有测试框架

第二张表刻意把Muse Spark 1.1的三个不同分数(Meta自报80.0分未列入表格但已在上一节说明、独立验证76.2分、Vals AI自测69.29分)都摆了出来,就是为了提醒读者:表格里排在Muse Spark 1.2前面或后面的其他模型分数,很多同样来自各厂商自己的发布图表,本身也未必经过统一口径的独立验证,横向比较时需要留一个心眼,不要把任何一张官方图表当成绝对客观的裁判结果。

十、对国内AI API中转站读者意味着什么

和本站此前报道的OpenAI Astra预告不同,Muse Spark 1.2不是一个"还没发布"的模型——它已经通过Meta Model API开放付费访问,并且已经上线OpenRouter,理论上具备了被中转站接入的技术条件。但有几个细节需要如实说明,而不是简单说"能用"或"不能用"。

第一,OpenRouter官方在1.2发布时提到"扩大了全球访问范围",相比1.1版本发布初期仅限美国地区开发者使用,这是一个明确的开放动作;但具体覆盖到哪些国家和地区,本文没有查到任何官方给出的详细清单,因此无法确认中国大陆是否已经被明确纳入其中——任何声称"官方已确认对华开放"的说法,目前都缺乏可核实的信源支撑。第二,Meta旗下的消费级AI产品(Meta AI App、WhatsApp、Instagram的AI功能等)长期以来都没有在中国大陆运营,这构成了一个合理但同样只是推测的参考背景:即便Meta Model API本身面向"全球"开放,实际能否从中国大陆直接访问,以及访问的稳定性如何,都还有不确定性,本文不会替读者下一个未经验证的结论。

第三,从技术角度看,因为Muse Spark 1.2已经上线OpenRouter,而OpenRouter本身就是很多中转站的上游算力聚合渠道之一,理论上已经在接入OpenRouter模型列表的中转站,具备把meta/muse-spark-1.2这个模型ID加入自己产品目录的技术条件,不需要重新走一遍和Meta的单独商务对接流程。但截至本文发稿,本站没有找到任何国内中转站已经公开宣布支持Muse Spark 1.2的官方公告——如果读者看到类似宣传,建议直接向对应厂商核实具体的模型ID、实际调用地区限制和真实价格,而不是仅凭宣传页面下结论。第四,由于Meta Model API本身兼容OpenAI SDK调用方式,同时支持Chat Completions、Responses、Messages三种协议格式,一旦有中转站接入,理论上可以直接复用现有针对OpenAI格式或Claude Messages格式模型的网关配置(比如LiteLLM、Claude Code Router),不需要额外开发一套专门的协议适配层,这一点对已经在用多模型网关方案的开发者是个实际利好。

十一、谁该用、谁该再等等

  • 对Token成本高度敏感、任务类型偏编程/Agent工作流的开发者 → Muse Spark 1.2目前的"每单位智能成本"在同档位模型里名列前茅,值得直接纳入选型对比。
  • 想尝试新型编程Agent架构设计的工程师 → Muse Code的常驻后台观察Agent+隔离Git worktree并行子Agent设计有真正的技术差异化,值得亲自试用体会和Claude Code、Codex CLI的实际差别。
  • 需要私有化部署、数据不能出内网的企业场景 → Muse Spark彻底闭源,不支持自托管和微调,目前完全不适用,应该考虑DeepSeek、Kimi、GLM等开源权重方案。
  • 依赖Windows或者需要IDE深度集成(VS Code/JetBrains插件)的开发者 → Muse Code发布时还没有覆盖这些场景,建议再观望几个版本,或者继续使用Claude Code等已经有成熟多端生态的工具。
  • 只看厂商自己发布图表就下结论的读者 → 建议对照本文第七节列出的独立验证数据,尤其是Terminal-Bench 2.1上Meta自报分数和Vals AI/官方验证榜单之间的落差,再决定要不要把"仅次于Claude Opus 5"这个说法当成定论。
  • 国内团队、习惯通过中转站接入海外模型的开发者 → 目前没有确凿证据显示中国大陆已被纳入官方"全球开放"范围,也没有查到任何中转站已公开支持的公告,建议持续关注、动手前先向具体厂商核实。

十二、结论

Meta Muse Spark 1.2是一个定位清晰的多模态推理与编程模型,不是外界可能望文生义联想到的图片/视频生成工具。它在2026年8月5日的这次发布里,真正立得住的亮点集中在四处:一是跑分性价比——按Artificial Analysis的计算,它是当前"智能指数"同档位模型里每任务成本最低的少数几个选项之一;二是Muse Code带来的架构创新——常驻后台观察Agent配合隔离Git worktree的并行子Agent设计,是一个和Claude Code、Codex CLI都不同的技术路径,而不是简单的模仿;三是跑分曲线本身的进步速度,四个月内从43分爬升到54分,在部分编程基准上已经贴近Claude Opus 5;四是原生多模态输入、100万token上下文,且已经通过Meta Model API和OpenRouter实现了相对开放的接入方式。

但同样需要如实交代的是:Meta自报的跑分数字(尤其是Terminal-Bench 2.1的82.9分)截至发稿还没有经过独立验证;上一代1.1版本的历史记录显示,Meta自报分数和第三方复现分数之间的落差可以超过10分;Muse Spark彻底闭源、不能自托管,和Meta此前Llama系列的开放策略是明显的掉头;Muse Code目前还是Beta状态,缺少Windows支持和IDE插件生态;更便宜的"贡献者"定价档需要用户让渡数据训练权限,不适合专业场景。对国内AI API中转站读者而言,最诚实的结论是:模型本身已经具备了被接入的技术条件(已上线OpenRouter、支持标准协议格式),但中国大陆是否被明确纳入官方开放范围、是否已有中转站正式支持,目前都缺乏可核实的信源,建议保持关注,动手前先向具体厂商核实清楚,而不是被任何一方的宣传话术带着走。

合在一起看,这意味着

如果你在意的是编程/Agent场景下的成本效率和新架构设计,Muse Spark 1.2和Muse Code现在就值得亲自试用;如果你需要私有化部署、Windows/IDE深度集成,或者对"官方跑分即真实水平"有较高期待,现在还不是最好的时机。

  • 成本敏感、做编程/Agent场景的开发者 → 现在就可以对比试用,性价比数据目前站得住脚。
  • 企业级私有化部署需求 → 目前无法满足,需要开源权重方案作为替代。
  • 国内中转站用户 → 模型已具备被接入的技术条件,但官方开放范围和中转站支持情况都还需要自行核实,不要轻信未经核实的"已支持"宣传。