2026年7月16日,月之暗面(Moonshot AI)正式发布 Kimi K3——2.8万亿参数,是迄今为止已发布的规模最大的开源权重模型;三天后的7月19日,阿里在上海WAIC世界人工智能大会上亮出 Qwen3.8-Max-Preview——2.4万亿参数,是通义千问系列第一个突破万亿参数门槛、同时具备多模态能力的模型。两者都把"仅次于Claude Fable 5"当作自己的宣传语,一场发生在72小时窗口期内的"中国AI军备赛"就此拉开。
但把这两个模型放在同一张对比表里,比看上去要复杂得多。本文想诚实地讲清楚四件事:
- 两者的规格、定价、独立跑分到底是什么——哪些数字有第三方验证,哪些只是官方自己的说法
- 一个必须先澄清的前提:Kimi K3 是已经正式开放的API,Qwen3.8-Max 目前只是一个"Preview"预览版,二者不是同一个成熟度量级的产品,"全面测评"这个说法本身需要先打上这个补丁
- 作为国内读者,如果想实际用上这两个模型,现实的接入路径是什么
目录
一、发布时间线:72小时内的两场发布
Kimi K3:2026年7月16日,月之暗面通过API和自家应用正式上线Kimi K3,官方称其为"全球首个3T级别的开放权重前沿模型"。模型权重目前尚未完全公开,官方口径是预计7月27日前后放出完整开放权重(具体开源协议类型截至本文调研时尚未正式公布)。上线后不到48小时,需求就出现了六倍级别的暴涨,月之暗面在7月19日宣布暂停新用户订阅,理由是GPU算力接近满载,需要优先保障存量付费用户的使用体验,官方表示会分批逐步放开新增名额。据多家财经媒体报道,月之暗面6月的年化收入(ARR)约3亿美元,5月估值已超200亿美元,目前正在洽谈新一轮融资、估值有望超过300亿美元,同时还在推进港股IPO。
Qwen3.8-Max-Preview:2026年7月19日,阿里在WAIC上海世界人工智能大会上发布Qwen3.8-Max-Preview,官方给出的定位是"仅次于Fable 5"。需要特别注意官方给这个模型的命名本身就带着"Preview"(预览)字样——这不是营销修辞,而是产品状态的如实标注:发布时没有随附任何官方跑分表、模型卡(model card)、开源协议说明,也没有披露激活参数量。"仅次于Fable 5"这个排名判断,目前只能追溯到阿里自己的内部评测,第三方权威评测机构(Artificial Analysis、LMArena)截至本文调研时(2026年7月20日)尚未对其进行独立评分。
先说清楚这一节最重要的一句话
这两个模型的发布间隔只有72小时,都拿Claude Fable 5当参照系,看起来像是一场对等的军备竞赛——但"对等"这个词用在这里并不准确。Kimi K3是一个已经上线、有真实公开定价、开始有第三方独立评测跟进的产品;Qwen3.8-Max-Preview是一个官方自己标注为预览版、无跑分表、无模型卡、只能通过有限渠道访问的早期展示。本文第七节会把这个差异拆得更细,但这里必须先立在最前面,避免读者带着"这是两个成熟度相同的产品"这个误解往下读。
二、规格参数对比:2.8T vs 2.4T,架构与上下文窗口
| 项目 | Kimi K3 | Qwen3.8-Max-Preview |
|---|---|---|
| 开发商 | 月之暗面 Moonshot AI | 阿里巴巴 / 通义千问 |
| 发布日期 | 2026年7月16日(API已正式上线) | 2026年7月19日(WAIC发布,明确标注为Preview) |
| 总参数量 | 2.8万亿(2.8T) | 2.4万亿(2.4T) |
| 架构 | 稀疏MoE,第三方逆向估算约896个专家中16个激活;官方技术报告尚未发布,第三方对激活参数量的估算从约320亿到600亿不等,本文不采用某个单一精确数字 | 稀疏MoE多模态模型;官方未公布激活参数量、专家数量等架构细节 |
| 上下文窗口 | 1,048,576 tokens(约1M),最大输出可设到与上下文等长,默认12.8万tokens | 官方称支持200K/400K/1M三档可配置窗口 |
| 推理/思考模式 | 始终开启"思考模式",可通过reasoning_effort参数在low/high/max三档间调节强度,但无法完全关闭 | 官方称内置思考模式,可在"深度推理"与"快速响应"间切换 |
| 输入模态 | 文本 + 图像(含视频帧理解) | 文本 + 图像 + 视频 + 文档 |
| 输出模态 | 仅文本 | 仅文本 |
| 官方模型卡/跑分表 | 有(随发布同步给出内部评测结果,并有第三方评测跟进) | 无(发布时未随附) |
| 开放权重 | 预计7月27日前后放出完整权重 | 官方表示"未来"会开源,未给出具体时间表 |
两组参数放在一起最直观的结论是:Kimi K3 在总参数量上略高一筹(2.8T vs 2.4T),但正如本文反复强调的,参数量本身不直接等于能力——训练数据质量、强化学习方法、路由架构和推理时的优化技巧,往往比单纯堆参数的影响更大。真正值得关注的差异其实是"官方到底公开了多少可验证的信息":Kimi K3至少给出了自己的内部评测结果并允许第三方跟进复核,Qwen3.8-Max-Preview目前连一张官方跑分表都没有。
三、性能跑分:独立验证 vs 自说自话
Kimi K3:已经有第三方独立评测数据
Kimi K3发布后,第一波独立验证很快跟进——Artificial Analysis、LMArena、Vals等第三方评测机构都已经完成了对它的测试,虽然官方也承认这仍只是"第一波"验证,一些更细分的第三方跑分聚合站(比如BenchLM)截至本文调研时仍未给出正式的综合排名。目前可以引用的、有明确出处的数据包括:
- Artificial Analysis Intelligence Index:Kimi K3 得分 57分,在其收录的189个模型中排名第4——排在Claude Fable 5和两档GPT-5.6 Sol推理设置之后,但领先于Claude Opus 4.8、GPT-5.5(xhigh档)、Claude Sonnet 5以及GLM-5.2
- LMArena Frontend Code Arena(真实用户投票的编程竞技场):Kimi K3 排名第1,胜率76%,积分1,679,比上一代Kimi K2.6跃升了17个名次;但在更综合的Text Arena(文本对话)上排名相对靠后,约第9位
- SWE-bench Verified:Kimi K3 得分 76.8%
这些数字的共同特点是:都能追溯到具体的第三方评测平台,而不是厂商自己的PPT。这是本文认为"Kimi K3的跑分优势相对可信"的核心理由。
Qwen3.8-Max-Preview:目前只有阿里自己的说法
与Kimi K3形成鲜明对比的是,Qwen3.8-Max-Preview发布时没有随附任何官方跑分表——"仅次于Fable 5"这句话,目前能找到的唯一来源就是阿里自己的内部评测口径。截至本文调研时(2026年7月20日),Artificial Analysis和LMArena均尚未对Qwen3.8-Max-Preview给出独立评分。多家海外科技媒体(包括对这次发布做了详细报道的几家评测博客)都明确指出:这个模型发布时既没有模型卡,也没有开源协议说明,也没有披露激活参数量——业内分析人士的普遍建议是,在独立验证出现之前,应该把"仅次于Fable 5"这类说法当作未经验证的营销定位,而不是可以直接采信的测试结论。
零星的社区实测:有意思,但不能当作权威跑分
社交媒体上确实已经出现了一些个人开发者做的头对头小测试——例如有人用一个269个文件的真实代码仓库分别测试两个模型的重构能力,Kimi K3拿到83/100,Qwen3.8-Max拿到80/100,Kimi完成更快、消耗token更少,但Qwen在系统边界划分上更干净;也有人用"一次性生成一个产品落地页"做测试,观察到Kimi在这个具体任务上明显更强,但Qwen3.8-Max生成的3D模型效果也让人印象深刻,且在这次测试中生成速度更快。这类测试确实有一定参考价值,但样本量通常只有一两个任务、没有披露完整方法论,本文不会把它们当作类似SWE-bench或LMArena那种可复现、大样本的权威跑分来引用——它们更适合当作"值得亲自动手再测一次"的信号,而不是定论。
四、价格全面拆解:这笔账目前根本没法直接算
价格对比通常是这类文章里最容易"一眼看懂"的部分,但这一次恰恰相反——两家的计费模式差异之大,导致严格意义上的"每百万token单价"对比目前几乎不可能做到。下面把双方能查到的所有数字都摆出来,诚实指出哪些是官方标价、哪些是第三方反推的估算。
Kimi K3:清晰的官方按量计费
| 计费项 | 美元 / 百万tokens | 人民币 / 百万tokens(platform.kimi.com) |
|---|---|---|
| 输入(缓存未命中) | $3.00 | ¥20 |
| 输入(缓存命中) | $0.30 | ¥2 |
| 输出 | $15.00 | ¥100 |
Kimi K3采用全上下文窗口统一定价——无论你用的是1千token还是接近1M token的上下文,单价都不变,没有"长上下文加价"这种常见的隐藏成本。上下文缓存是自动管理的,不需要开发者显式声明,官方表示在编程类工作负载上缓存命中率能做到90%以上,这意味着"反复问同一份长代码库/长文档"的场景实际成本会显著低于按缓存未命中价格估算的数字。需要留意的一点是:K3的思考模式始终开启且默认强度为最高档(max),这会推高输出token的实际消耗量,即使单价不变,总账单也可能比预期更高。
Qwen3.8-Max-Preview:没有独立的标准价格页面
这是本节最需要诚实讲清楚的地方:Qwen3.8-Max-Preview目前没有一个可以直接注册、按官方$/M tokens标价付费的独立API入口。它只能通过阿里云百炼旗下的 Token Plan(订阅制额度包)、以及编程工具 Qoder / QoderWork 这几个渠道访问。
| 项目 | 情况 |
|---|---|
| 官方渠道 | 仅限Token Plan(阿里云百炼旗下)、Qoder、QoderWork,无独立公开的标准按量计费页面 |
| 预览期折扣(官方口径) | 标准价的10% |
| 非高峰时段折扣(北京时间22:00-08:00) | 在预览价基础上进一步大幅折扣,第三方测算认为实际低至标准价的约1/50 |
| 第三方反推的预览期有效单价(非官方估算,仅供参考) | 约 $0.17 / M 输入,约 $0.51 / M 输出 |
| 由此反向推算的"标准价"(同样是非官方估算) | 约 $1.70 / M 输入,约 $5.10 / M 输出 |
| Token Plan 个人版订阅(另一种计费入口,非按token计费) | Lite档约¥39/月起(约合$6);Standard档约$20/月;Pro档约$70/月 |
为什么这张表不能直接拿来和Kimi K3比价
第一,Qwen3.8-Max-Preview没有官方公布的标准单价,表格里"标准价"那一行是第三方从预览折扣价反推出来的估算数字,不是阿里官方承诺的价格,预览期结束后完全可能是另一个数字;第二,Token Plan本质上是订阅制额度包而非纯粹的按量计费,和Kimi K3"官方$/M tokens标价、随时可注册直接付费调用"的模式不是同一种商业逻辑;第三,预览期价格本身会随时间推移而调整——官方多次强调"预览期间模型能力会持续迭代升级",价格大概率也会同步变化。综合以上三点,本文认为目前诚实的结论是"无法做严格意义上的同单位价格对比",而不是勉强凑一个数字出来误导读者。
如果一定要给一个方向性判断:即便用第三方反推的估算值做参照,Qwen3.8-Max-Preview预览期的实际到手价格大概率明显低于Kimi K3的官方标价——但这更多是"限时预览折扣"带来的暂时优势,而不是两个模型长期稳定价格结构的真实比较。愿意为长期稳定、可预测的按量计费买单的用户,目前Kimi K3是更清晰的选择。
五、多模态理解能力:图像/视频/文档输入的真实差异
多模态这件事上真正值得比较的,是"输入理解"这一侧各自的侧重点。
Kimi K3的多模态卖点延续了月之暗面一贯的产品基因——长文档处理。K3的原生视觉理解被官方描述为可以识别图片中的文字、颜色和物体形状,配合1M token的超长上下文,实际使用场景更偏向"把一整份图文混排的长报告/长手册丢进去,让模型综合图文内容作答",这和月之暗面此前Kimi K2.7系列在法律合同、金融文档审查上积累的产品思路是一脉相承的。
Qwen3.8-Max-Preview官方在发布通稿里特别把"文档理解"单独列为一项核心能力(而不是把它并入笼统的"图像理解"),这可能和阿里云百炼在企业市场里积累的合同、财报、PPT解析类需求直接相关——文档理解通常还涉及版式、表格、图表这类比纯自然图像更结构化的内容,是国内企业客户采购AI服务时经常提出的具体需求。此外官方通稿里还提到该模型具备"全模态能力,覆盖文本、语音、图像",但截至本文调研时,语音这部分的具体能力边界(是否支持语音输入理解、支持到什么程度)官方尚未给出详细说明,本文对这一点持保留态度,不做进一步展开。
一句话总结:两者在"图像/视频看得懂"这件事上大方向一致,但Kimi K3的产品叙事更偏"超长上下文+图文综合理解",Qwen3.8-Max-Preview更强调"文档结构化理解"这个更贴近企业办公场景的细分能力。目前没有第三方对这两项能力做过定量对比测试,以上判断主要基于双方官方通稿的表述侧重,供读者参考,不构成实测结论。
六、"完全开放"和"预览版"是两回事——诚实的成熟度对比
这一节把第一节埋下的伏笔完整展开。之所以反复强调这一点,是因为这直接决定了"全面测评"这个说法本身能做到多"全面"。
| 维度 | Kimi K3 | Qwen3.8-Max-Preview |
|---|---|---|
| 产品状态 | 正式发布,公开API已上线 | 官方明确标注为"Preview"预览版 |
| 访问方式 | api.moonshot.ai / platform.kimi.com 均可直接注册获取Key(当前因需求暴涨暂停新用户订阅,存量用户不受影响) | 仅限Token Plan、Qoder、QoderWork几个有限渠道,无独立公开注册入口 |
| 官方跑分表/模型卡 | 有 | 无 |
| 第三方独立评测 | 已有Artificial Analysis、LMArena、Vals等机构给出评分 | 截至本文调研时(2026年7月20日)尚未被任何主流第三方机构收录评测 |
| 标准定价页面 | 有,$/M tokens明码标价 | 无独立标准价,只有预览期折扣价和第三方反推估算 |
| 开源权重 | 预计7月27日前后放出完整权重 | 官方仅表示"未来会开源",无具体时间表和协议类型 |
| 能力是否会变化 | 发布即为正式版本,后续更新走版本迭代路径 | 官方明确说明"预览期间模型能力会持续迭代升级"——也就是说,你今天测出来的结果,未必是最终版本的结果 |
把这张表看完,一个诚实的类比是:这更像是拿一款已经全球公开发售的手机去和一款厂商内部发布会上展示、只对少数渠道和邀请用户开放内测、功能还在持续调整的手机做对比。两者当然可以放在一起讨论,本文也确实这么做了,但如果读者把这篇文章理解成"两个完全同等成熟度产品的正面对决",那就误解了本文想传达的核心信息——Qwen3.8-Max-Preview值得关注,但它现在的一切数据和结论都应该被当作"预览期的初步信号",而不是最终定论。等它转为正式版本、有了独立跑分和公开定价之后,这个对比才谈得上真正"公平"。
七、国内读者怎么接入这两个模型
和GPT/Claude不同,Kimi、Qwen这类国产模型在中国大陆本身就有官方直连渠道,不存在"需要翻墙"的问题,中转/聚合服务对它们的价值更多在于"多模型统一账号管理"而不是"解决访问障碍"。
Kimi K3官方直连:国内走 platform.moonshot.cn,海外走 api.moonshot.ai / platform.kimi.com,两者定价体系分别以人民币和美元计价。本站的月之暗面 Kimi API 测评已经在跟踪Kimi系列的定价与上下文缓存机制,需要注意的是,由于近期需求暴涨,官方目前暂停了新用户订阅通道,如果你还没有账号,可能需要等待官方分批放开名额,或者先通过已经上架Kimi K3的第三方平台过渡。
Qwen3.8-Max-Preview官方直连:目前只能通过阿里云百炼(bailian.aliyun.com)旗下的Token Plan、或者Qoder/QoderWork这两个编程工具接入,本站的阿里云百炼测评覆盖了这个平台的企业级资质、RAM权限管理等背景信息,但请注意该测评撰写时Qwen3.8-Max-Preview的具体接入细节仍在快速变化中,实际使用前建议以百炼控制台当前页面为准,确认自己要用的具体产品(Token Plan个人版/团队版、还是Qoder/QoderWork)是否已经放开该模型的调用权限。
第三方聚合/中转平台:由于这两个模型都非常新(Kimi K3发布约5天,Qwen3.8-Max-Preview发布约2天),大部分中转站的模型列表更新存在滞后,下单前务必确认平台是否已经真正上架了具体的模型ID(kimi-k3 / qwen3.8-max-preview),而不是还停留在上一代的kimi-k2.7或qwen3-max。本站已核实硅基流动 SiliconFlow在其模型广场中已列入kimi-k3;对于开放权重发布后的Kimi K3以及未来的Qwen3.8正式版,托管开源模型权重的云推理平台(如硅基流动、魔搭社区等)通常会是较早跟进上架的渠道之一。完整的中转站横向对比可以参考本站的 AI API中转站对比看板。
官方文档示例(未实际调用,仅供参考格式)
Kimi K3通过OpenAI兼容接口调用的典型格式:
from openai import OpenAI
client = OpenAI(
api_key="你的Kimi API Key",
base_url="https://api.moonshot.ai/v1" # 国际站;国内为 https://api.moonshot.cn/v1
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": "帮我审查这份100页的合同,找出所有对甲方不利的条款"}
],
extra_body={"reasoning_effort": "max"} # K3思考模式始终开启,可调低/高/最高三档强度,无法完全关闭
)
print(response.choices[0].message.content) Qwen3.8-Max-Preview通过阿里云百炼dashscope兼容模式调用的典型格式(需要Token Plan/Qoder额度):
from openai import OpenAI
client = OpenAI(
api_key="你的Token Plan / 百炼 API Key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.chat.completions.create(
model="qwen3.8-max-preview",
messages=[
{"role": "user", "content": "帮我总结这份PDF年报里的核心财务风险"}
]
)
print(response.choices[0].message.content)
# 注意:Qwen3.8-Max-Preview目前只能通过Token Plan/Qoder/QoderWork额度调用,
# 没有独立公开的按量计费Key可以直接注册获取,具体端点与模型ID请以官方文档实时更新为准 八、该怎么选:真实场景的建议
场景一:需要今天就上生产、要可预测的按量计费
如果你的项目现在就要接入模型、需要清晰稳定的$/M tokens定价、并且希望有第三方独立跑分作为选型依据,Kimi K3是更现实的选择——它是一个已经公开发售、有独立评测跟进的正式产品,即便当前因为需求暴涨暂停了新用户注册,这也是"太受欢迎"而非"产品不成熟"导致的限制,属于可以等待恢复的临时状态。
场景二:愿意接受预览版的不确定性,想第一时间体验阿里最新技术
如果你更看重"抢先体验阿里最新技术方向",并且能接受预览版特有的限制——渠道有限、没有独立跑分背书、能力还在持续调整、价格随时可能变化——Qwen3.8-Max-Preview值得作为实验性选项去尝试,尤其是文档理解这类企业场景,可以用来提前评估阿里云百炼生态未来的多模态能力方向。但不建议把生产环境的核心业务现在就绑定在一个"Preview"状态的模型上。
九、常见问题
Q:Kimi K3 和 Qwen3.8-Max,我现在该选哪个?
A:如果需要稳定的生产环境、清晰定价、且有第三方跑分支撑,选Kimi K3;如果只是想抢先体验、能接受预览版的各种不确定性,可以试试Qwen3.8-Max-Preview,但不建议把核心业务现在就绑定在预览版上。
Q:为什么找不到Kimi K3 vs Qwen3.8-Max的权威跑分对比表?
A:因为Qwen3.8-Max-Preview截至本文调研时还没有被Artificial Analysis、LMArena等权威第三方机构收录评测,官方自己也没有发布跑分表。市面上能看到的头对头对比大多来自个人开发者在社交媒体上做的小样本测试,有参考价值但不是权威跑分,本文选择如实说明这一点,而不是拼凑一个看似权威实则不存在的数字。
Q:Qwen3.8-Max-Preview什么时候会转正、什么时候开源?
A:官方目前只表示"未来会开源",没有给出具体时间表;从预览版转为正式版本的时间也未公布。相比之下,Kimi K3的完整开放权重官方口径是预计2026年7月27日前后放出,时间线更明确。
Q:Kimi K3为什么突然暂停了新用户订阅?
A:多家媒体报道称,Kimi K3上线48小时内需求出现六倍级别的暴涨,月之暗面的GPU算力接近满载,为了保障存量付费用户的使用体验,官方在7月19日暂停了新用户订阅,并表示会分批逐步恢复,已有账号的用户不受影响。
Q:普通开发者能通过中转站/聚合平台用上这两个模型吗?
A:理论上可以,但由于两者都非常新,很多平台的模型列表还没跟上,下单前一定要确认平台是否真正上架了kimi-k3或qwen3.8-max-preview这两个具体模型ID,而不是还在提供上一代版本。
Q:2.8T和2.4T这两个参数量数字,谁的模型"更强"?
A:参数量更大不直接等于能力更强,尤其是两者都采用稀疏MoE架构、实际每次推理激活的参数量远小于总参数量。目前唯一有第三方独立验证支撑的跑分优势属于Kimi K3;Qwen3.8-Max-Preview的"仅次于Fable 5"说法目前只是阿里自己的判断,尚待独立验证。
总结:诚实地给出这四个结论
- 不是同一成熟度的对比:Kimi K3是已正式上线、有独立跑分背书的公开产品;Qwen3.8-Max-Preview是阿里自己标注的预览版,没有跑分表、模型卡,也没有独立验证——这个前提必须先说清楚,再谈其他一切对比
- 跑分方面,Kimi K3目前有更可信的第三方数据:Artificial Analysis Intelligence Index第4名(57分)、LMArena Frontend Code Arena第1名、SWE-bench Verified 76.8%;Qwen3.8-Max-Preview的"仅次于Fable 5"目前只是官方自己的说法,尚未被第三方证实或证伪
- 价格没法直接比:Kimi K3有清晰的官方$/M tokens标价(输入$3/输出$15,缓存命中低至$0.30);Qwen3.8-Max-Preview只能通过Token Plan/Qoder等订阅渠道以预览折扣价访问,没有独立标准价格页面,任何"标准价"都是第三方反推的估算
- 选型建议直白说:要稳定生产环境选Kimi K3;愿意尝鲜、能接受预览版不确定性选Qwen3.8-Max-Preview
随着Kimi K3完整开放权重在7月27日前后落地、以及Qwen3.8正式版和独立跑分逐步出现,这篇文章里"暂无数据"的部分会陆续被填上——但截至发稿,以上就是能够诚实给出的全部结论。