2026 年 8 月 13 日,可能是这轮大模型价格战里最"安静"却信息量最大的一夜。凌晨,DeepSeek 没有开发布会、没有群发新闻稿,只是默默把官方 API 文档里的模型版本更新成了 DeepSeek-V4-Pro-0813——预览版发布整整 111 天后,旗舰正式版就这样上线了;同一夜,xAI(已并入 SpaceX 成为 SpaceXAI)在 X 上发了一句 "Introducing Grok 4.6"。一个改文档,一个发推,但两家押注的是同一个赛道:用相当于西方顶级闭源模型一半甚至更低的价格,卖一个够格的旗舰级模型。这篇文章就把这两枚"半价核弹"放在同一张桌子上对撞,告诉你它们的真实差距、各自的算盘,以及——对本站读者最实际的问题——国内中转站现在能不能用、怎么选。
需要先交代本文的事实纪律:DeepSeek 侧的规格、跑分与定价,以 DeepSeek 官方 API 更新日志为准;Grok 4.6 侧,以 xAI 官方发布信息、Artificial Analysis 的独立评测,以及 FoneArena 等第三方报道为准。凡属厂商自报、尚无独立验证的数字,本文会明确标注;凡不同来源互相矛盾、无法交叉验证的数字,本文会直接说"无法核实",不会为了让对比表格显得更完整而编造。尤其是两家厂商的自报跑分与第三方评测之间存在不小的落差,这正是本文想重点拆开的地方。
目录
一、同夜对撞:一个凌晨改文档,一个深夜发推
先说清楚这次"对撞"的时间线,因为它本身就说明了很多事。DeepSeek 于 4 月 24 日推出 V4 系列,当时 Pro 和 Flash 都标注为 Preview(预览版);7 月 31 日,DeepSeek 先把较小、迭代更快的 V4 Flash 推进到 0731 正式公测版(本站已在 V4 Flash 深度测评 里详细写过那次"同一套参数重新训练、DeepSWE 从 7.3 涨到 54.4"的升级),而 V4 Pro 一直停留在 Preview。8 月 13 日凌晨,旗舰正式版 DeepSeek-V4-Pro-0813 终于落地——距 4 月 24 日预览版发布恰好 111 天。
几乎是同一个凌晨,xAI 发布了 Grok 4.6,距上一代 Grok 4.5(7 月 8 日发布)只有一个多月。这是 xAI 并入 SpaceX 之后、以 SpaceXAI 名义发布的第一代模型。两家都不约而同选择了"不开发布会"的低调节奏,但原因完全不同:DeepSeek 一贯如此,偏好用文档说话;xAI 则把更多力气花在自家生态(Cursor、Grok Build、X)的即刻上线上。两家在同一夜各自更新了旗舰,等于把 2026 年下半年的竞争主题直接摆上了台面——不是"谁的参数多",而是"谁的后训练调得更好、谁的单位价格更狠"。
这里还埋着一个需要读者注意的上下文:DeepSeek 在正式版文档里同步预告了"近期将整体上调 API 定价"(第三方转述为"涨幅显著"),而本站此前已核实,7 月中旬传闻的 V4 Pro"高峰期动态溢价"机制截至发稿仍未实际生效。也就是说,你现在看到的 V4 Pro 定价很可能是未来一段时间内最便宜的窗口。这两个信息(涨价预告 + 峰谷电价未落地)都还没有具体数字,本文只做事实转述,不做猜测。
二、规格对撞:1.6T/49B vs 约1.5T,两个都不靠堆参数
先摆硬规格,再讲人话。DeepSeek V4 Pro 正式版与 Grok 4.6 的核心参数如下:
| 规格 | DeepSeek V4 Pro 0813 | Grok 4.6 |
|---|---|---|
| 架构 | MoE,总参数约 1.6T,激活约 49B | MoE,总参数约 1.5T(马斯克口径,未完全独立验证) |
| 上下文窗口 | 100 万 token | 50 万 token |
| 最大输出 | 38.4 万 token | 官方未设输出上限说明 |
| 模态 | 文本为主;正式版新增原生图像推理(DeepThink 引擎) | 文本 + 图像输入,文本输出 |
| 推理档位 | Non-Think / Think High / Think Max | Low / Medium / High(默认)/ XHigh |
| 并发上限 | 500 | 官方未公布 |
两家有一个共同点值得单独说:Grok 4.6 没有扩大参数量。据 xAI 官方口径,4.6 沿用与 4.5 相同的约 1.5T 参数的 V9 底座,改进几乎全部来自后训练——用模型自己生成的推理与工程技术数据重建了各领域的 SFT 轨迹,再在代码、内核优化、Web 开发、CAD 等 agent 环境里做强化学习。这和 DeepSeek V4 系列的思路几乎一模一样:架构和参数不动,靠重做后训练把能力"榨"出来。两家在同一个时间点、用同一种打法,这本身就是 2026 年下半年竞争重心已经从"堆参数"转向"调后训练"的最直接证据。
上下文窗口上,DeepSeek V4 Pro 的 1M token 明显大于 Grok 4.6 的 500K——对长文档、整仓级代码重构这类场景是实打实的差异。代价是 DeepSeek 侧并发只有 500,批量压测前建议先跟官方报备。模态上,DeepSeek V4 Pro 的正式版补上了预览版缺失的图像推理能力(据第三方实测报道,图像能力正是预览版的明显短板),而 Grok 4.6 从 4.5 起就是原生多模态输入。这一点对后文选型很重要:如果你的任务需要"看得懂截图/设计稿",两边现在都能做,但 Grok 4.6 的多模态更成熟。
三、跑分对撞:为什么 DeepSeek 官方数字"看着更猛",第三方 AAII 却是 53 对 61
这一节是全文最需要打起精神看的部分,因为这里藏着一个非常容易踩的坑:DeepSeek 官方自报的 agent 跑分涨得很凶,但第三方 Artificial Analysis 给 V4 Pro 的智能指数(AAII)只有 53,而 Grok 4.6 是 61。两套数字摆在一起,不是矛盾,而是说明"官方自报"和"第三方统一口径"是两回事——本文把两套都摆出来,并明确标注来源。
先看 DeepSeek 官方在 0813 更新日志里公布的、与 4 月预览版的对比(以下为官方自报,尚无大规模第三方复测):
| 基准 | V4-Pro-Preview(4月) | V4-Pro-0813(8月) |
|---|---|---|
| DeepSWE | 12.8 | 62.7 |
| Terminal-Bench 2.1 | 72.1 | 87.9 |
| CyberGym | 52.7 | 83.3 |
| NL2Repo | 38.5 | 61.5 |
| DSBench-Hard | 31.1 | 67.2 |
| DSBench-FullStack | 41.8 | 71.1 |
| Toolathlon-Verified | 55.9 | 74.1 |
| HLE(with tools) | 48.2 | 60.0 |
| AutomationBench | 12.8 | 31.8 |
| Agents' Last Exam | 16.5 | 25.7 |
注意 DeepSWE 一项:从 12.8 涨到 62.7,涨幅接近 5 倍——和 V4 Flash 那次"重训练一次翻 7 倍"是同一个路数。DeepSeek 官方还给出了一些与竞品的对照:在 DeepSWE 上 V4 Pro 的 62.7 高于 Claude Opus 4.8 的 58.0,在 Terminal-Bench 2.1 上 87.9 高于 Opus 4.8 的 85.0,CyberGym 的 83.3 也略高于 Claude Fable 5 的 83.1;但面对更强的 Claude Fable 5,它仍在 Toolathlon(74.1 vs 77.9)、DSBench-FullStack(71.1 vs 77.2)、DeepSWE(62.7 vs 70.0)上落后。这些数字全部来自 DeepSeek 官方口径。
再看 Grok 4.6。第三方评测机构 Artificial Analysis 给出的智能指数(AAII)是 61,追平 OpenAI GPT-5.6 Sol Max(61),落后 Claude Opus 5 Max(63)和 Claude Fable 5 Max(62)1~2 分;作为参照,Grok 4.5 只有 56,4.3 只有 38——也就是说 Grok 4.6 在一个月里把第三方综合分从 56 拉到了 61。在具体分项上,Grok 4.6 的强项集中在 agent 型知识工作:GDPVal-AA v2 的 Elo 1753 是当前公开竞品里最高的(Fable 5 Max 为 1741、GPT-5.6 Sol 为 1728);AA-Briefcase(长时程知识工作)Elo 1577,达到 Fable 5 档位;在法律垂直域 Harvey LAB 上 15.8%,远超 GPT-5.6 Sol 的 2.5%。它也有明显短板:DeepSWE v1.1 只有 65.9%(虽较 4.5 的 54% 提升明显,但低于 Sol Max 的 73% 和 Fable 5 Max 的 70%),Terminal-Bench v3.0 只有 26%,明显落后于竞品约 34%~35% 的水平。
这里必须给读者划一条诚实的分界线:DeepSeek 官方列表里的 "Terminal-Bench 2.1 87.9" 和 Grok 4.6 的 "Terminal-Bench v3.0 26" 完全不可比——两者是不同的基准版本、不同的方法论。任何人把这两个数字直接相减然后说"DeepSeek 碾压 Grok",都是在拿苹果比橘子。同样,DeepSeek 的 DeepSWE(62.7)与 Grok 4.6 的 DeepSWE v1.1(65.9)虽然同名,但版本与评测口径也不同。这也是为什么第三方统一口径的 AAII 数字反而更有参考价值:在 Artificial Analysis 眼里,Grok 4.6 的综合分比 DeepSeek V4 Pro 的 53 分高出 8 分,排名也更靠前。至于哪家的自报数字更可信,需要等第三方复测——在 LMSYS Chatbot Arena 等公开竞技场上看到双方出现之前,本文对两家的自报分数都保持"存疑但转述"的态度。
怎么理性看待这轮跑分对撞
官方自报的 agent 跑分涨得快,说明后训练确实在进步,但它不能替代第三方统一口径的比较。目前最干净的第三方数字是:AAII 上 Grok 4.6 为 61、DeepSeek V4 Pro 为 53。如果你只信第三方,结论很清楚;如果你想看"官方在各自擅长的 agent 任务上能跑多高",那 DeepSeek 的自报数字同样值得记录。两套数据并存,别混着用。
四、定价对撞:输出价差约 7 倍,缓存命中价差超过 100 倍
如果说跑分是各有千秋,那定价就是这次对撞里最"一眼看穿"的部分。以下价格均为官方 API 首方定价(非中转站折扣价),DeepSeek 以人民币计、本文附美元换算,Grok 以美元计:
| 模型 | 上下文 | 输入 $/M | 缓存命中 $/M | 输出 $/M |
|---|---|---|---|---|
| DeepSeek V4 Pro 0813 | 1M | $0.435(¥3) | ≈$0.0036(¥0.025) | $0.87(¥6) |
| DeepSeek V4 Flash 0731 | 1M | $0.14 | ≈$0.0028 | $0.28 |
| Grok 4.6(提示词<200K) | 500K | $2.00 | $0.50 | $6.00 |
| Grok 4.6(提示词≥200K,翻倍) | 500K | $4.00 | $1.00 | $12.00 |
| GPT-5.6 Sol(对照) | — | $5.00 | — | $30.00 |
| Claude Opus 5(对照) | — | $5.00 | — | $25.00 |
| Claude Fable 5(对照) | — | $10.00 | — | $50.00 |
这张表能读出几个关键结论。第一,DeepSeek V4 Pro 在输出端约是 Grok 4.6 的 1/7($0.87 vs $6.00),输入约 1/4.6($0.435 vs $2.00);相对 Claude Fable 5($10/$50),V4 Pro 的输出价约是它的 1/57,第三方报道里"价格只有 Fable 5 的约 2%"说的就是这件事。第二,缓存命中价差更夸张:DeepSeek V4 Pro 缓存命中约 $0.0036/M,Grok 4.6 是 $0.50/M,相差超过 100 倍——如果你的应用有大量重复前缀、重度依赖 prompt caching,这个数字会直接决定账单规模。
但 Grok 4.6 的定价也不是没有章法。它保持 $2/$6 不变,定位是"同级前沿模型的约一半"——相对 GPT-5.6 Sol($5/$30)和 Claude Opus 5($5/$25),输出端便宜约 60% 甚至更多。也就是说,两家的"半价"是针对不同的参照系:DeepSeek 是拿自己相对所有闭源旗舰都便宜(绝对低价),Grok 4.6 是拿自己相对同水平西方旗舰便宜一半(档位价差)。还有一个容易忽略的细节:Grok 4.6 提示词超过 200K token 时输入输出直接翻倍($4/$12),且缓存命中价从 Grok 4.5 的 $0.30 涨到了 $0.50——长上下文 + 重缓存场景下,Grok 的实际成本会比宣传数字更高,选型时要按自己的提示词长度估算。
DeepSeek 侧的定价还有一个必须重申的未知数:官方已预告"近期整体上调 API 定价",且传闻中的"高峰期动态溢价"截至发稿仍未生效。换句话说,本文写下的 V4 Pro 价格(¥3/¥6)是当前官方实价,但很可能不是长期价——这一点本站此前在 DeepSeek 涨价追踪 里已经反复强调过,本文不再展开。
算一笔具体的账,能让"价差 7 倍"更直观。假设你要做一个基于 10 万 token 文档、输出约 2 万 token 的深度分析任务:用 DeepSeek V4 Pro,输入成本约 $0.435 × 0.1 ≈ $0.044,输出约 $0.87 × 0.02 ≈ $0.017,单任务合计不到 $0.07;用 Grok 4.6,输入 $2 × 0.1 = $0.20,输出 $6 × 0.02 = $0.12,合计 $0.32——约 4.6 倍。这还没算缓存命中:如果文档前缀被大量复用,DeepSeek 的命中价几乎可以忽略不计,而 Grok 4.6 每次命中 $0.50/M,会在长会话里持续累加。当然,Grok 4.6 的"成本/任务"并非没有优势:Artificial Analysis 测算它完成一次长时程 agent 任务(AA-Briefcase)的平均成本约 $0.84,凭借极致的 token 效率(约 53 步、0.5B 输入 token,而 Claude Opus 5 Max 要约 103 步、2.0B)站上了"智能-成本"帕累托前沿。只是对预算敏感的国内应用来说,DeepSeek 的绝对低价通常更有吸引力。
五、生态对撞:OpenAI + Anthropic 双兼容 vs SpaceXAI 全家桶
规格和价格之外,这一轮对撞里最能体现两家"打的不是同一场仗"的,是生态策略。
DeepSeek V4 Pro 打的是"开放生态、双协议兼容"。官方 API 同时兼容 OpenAI 的 Chat Completions 与 Responses API,还兼容 Anthropic 的 Messages 格式——这意味着你不需要任何适配层,就能把 Claude Code 通过环境变量指向 DeepSeek,也能把 Codex 这类原生用 Responses API 的工具直接接上。DeepSeek 的权重还以 MIT 协议开放在 Hugging Face 上,任何中转站、任何自托管集群都能自行部署。对国内开发者来说,这几乎是零迁移成本:改个 base_url 和 key,别的都不用动。
Grok 4.6 打的是"自有生态、即刻上线的全家桶"。它发布当天就成为 Cursor 和 Grok Build 的默认模型,还上线了 xAI API、OpenRouter、Vercel、Cloudflare 等平台,首发第一周还有双倍额度。它在 X/Grok 消费端有马斯克本人的话题效应,在 Cursor 这类编程工具里是"开箱即用"的选项。但代价是:它不是开放权重,国内不能直连官方,多模态和 agent 能力的优势更多体现在西方生态与消费端场景里。
把这两条路线放到本站读者(国内开发者、中转站用户)的视角看:DeepSeek 的"双生态兼容 + 国内直连 + MIT 开源"几乎是为你量身定做的;Grok 4.6 则需要通过中转站或 OpenRouter 才能稳定访问,优势集中在"想要第三方跑分更高的旗舰、且能接受经中转层访问"的场景。这也是后文选型结论的基础。
六、国内中转站接入现状:谁已经在卖,谁还没更新
先说 DeepSeek V4 Pro。它最直接的入口永远是官方平台 platform.deepseek.com——国内直连、无需科学上网,模型名仍是 deepseek-v4-pro,存量代码一行不用改,服务端直接换了新权重。从本站已核实的供应商信息看,多家已收录的中转站此前就支持 deepseek-v4-pro 模型 ID,包括硅基流动(SiliconFlow)、老张API、YKH.AI、FlowBar、UiUiAPI,以及 OpenRouter、CloseAI、4SAPI、302AI、AIHubMix、RunAPI、DuckCoding、TokenRiver 等。由于这次升级没有改模型 ID,任何转发官方接口的中转站理论上会直接吃到 0813 正式版;但如果是自建托管 DeepSeek 开源权重的中转站,就需要自行跟进新权重,具体以各家公告为准。
再看 Grok 4.6。官方口径已明确它上线了 xAI API、Cursor、Grok Build 和 OpenRouter。对国内中转站读者来说,最务实的确认方式是:你的中转站/网关是否把模型列表更新到了 grok-4.6。从本站收录情况看,Grok 系列的中转覆盖本来就不少——OpenRouter、CloseAI、4SAPI、147API、诗云API、AIHubMix、RunAPI、APIYi、PoloAPI、DuckCoding、FlowBar、302AI、TokenRiver、神马API 都挂过 Grok 4.3/4.5,其中 RelayDance 更是把 Grok 作为专项中转特色("国内能稳定接入 Grok 的平台不多")。但"挂过 Grok 4.5"不代表"已经更新到 4.6"——Grok 4.6 刚发布,各家是否跟进 grok-4.6 模型 ID、价格怎么定,需要你在选型时逐个核对最新公告。
如果你用 LiteLLM / OpenRouter 这类聚合层,接入逻辑和之前完全一样,只需把模型名换成对应 ID 即可:
model_list:
- model_name: deepseek-v4-pro
litellm_params:
model: openai/deepseek-v4-pro
api_base: https://api.deepseek.com
api_key: os.environ/DEEPSEEK_API_KEY
- model_name: grok-4.6
litellm_params:
model: grok/grok-4-6
api_key: os.environ/XAI_API_KEY 务必提醒:以上模型 ID 是官方/主流网关的习惯写法,不代表每一家中转站都已上线 grok-4.6。 DeepSeek 侧因为模型 ID 不变、风险低;Grok 侧刚发布,建议以各中转站控制台实际列出的模型为准,别因为本文写了 ID 就直接上线生产流量。
七、选型结论:什么场景选谁
- 国内开发者 + 预算敏感 + 要 1M 上下文/长文档/整仓代码 → 直接上 DeepSeek V4 Pro。国内直连、双生态兼容、价格是 Grok 的 1/4.6~1/7,唯一要注意的是官方"近期涨价"预告——想锁价格就趁早。
- 重度依赖 prompt caching 的批量应用 → DeepSeek V4 Pro 的缓存命中价(约 $0.0036/M)比 Grok 4.6($0.50/M)便宜超过 100 倍,这个场景没有悬念。
- 要第三方跑分最高的旗舰 + 原生多模态 + agent 型知识工作 → Grok 4.6。AAII 61 追平 GPT-5.6 Sol Max,GDPVal-AA 领先,但成本是 DeepSeek 的 7 倍以上,且要通过中转/OpenRouter 访问。
- 交互式前端生成、Cursor / Grok Build 工作流 → Grok 4.6 是默认模型、开箱即用,这是它最顺的场景。
- 高并发、低复杂度的批量/子任务 → 还是 V4 Flash($0.14/$0.28、并发 2500)更合适,把 Pro 留给真正难的任务,两档搭配最省钱。
- 想要"可自托管、可换供应商、不锁死生态" → DeepSeek(MIT 开源权重)是唯一选项,Grok 4.6 闭源。
八、结论:这一夜真正的信号
DeepSeek V4 Pro 正式版和 Grok 4.6 的同夜发布,表面看是两枚"半价核弹"对撞,实际上揭示了 2026 年下半年大模型竞争的两个确定性趋势。
第一个趋势:竞争重心已经从"堆参数"转移到了"后训练 + 单位价格"。两家都明确表示这代没动架构和参数量,提升全靠重做后训练;两家都把自己的定价钉在"西方顶级闭源旗舰的一半甚至更低"。当 OpenAI、Anthropic 还在 $5~$10/M 输入、$25~$50/M 输出的价位上时,DeepSeek 和 Grok 已经用 $0.44~$2 的输入价提供了旗舰级能力。对预算敏感的应用来说,这个价位段的选择第一次变得如此拥挤且具有可比性。
第二个趋势:所谓"对撞",更多是同一战场的不同站位。DeepSeek 是"绝对低价 + 开放生态 + 中国可直连"的价格/性能之王,打的是成本和生态自由度;Grok 4.6 是"相对西方旗舰半价 + SpaceXAI 全家桶 + 第三方跑分最高"的西方/消费端打法,打的是体验和生态整合。二者真正的交集,是都逼着 OpenAI、Anthropic、Google 的旗舰价位重新接受审视——而它们之间的选择,取决于你的场景在"成本、开放、直连"还是"跑分、体验、生态"这一轴上的位置。
合在一起看,这意味着
- 国内 + 预算敏感 + 要长上下文/双生态兼容 → DeepSeek V4 Pro,趁涨价前锁价,官方直连即可。
- 要第三方最高分 + 原生多模态 + Cursor/Grok Build → Grok 4.6,经中转/OpenRouter 访问,注意 200K 以上提示词会翻倍。
- 纯批量/子任务 → 仍选 V4 Flash 分流,成本最优。
- 两个提醒:DeepSeek 官方已预告近期整体涨价、峰谷电价未落地;Grok 4.6 刚发布,各中转站的
grok-4.6模型 ID 需逐个核实后再接生产流量。