如果你只看一个数字,看这个就够了:DeepSeek-V4-Flash-0731 在 DeepSWE 基准上的得分是 54.4,而三个月前的 Preview 版本只有 7.3——同一套架构、同一个参数量,模型权重的"骨架"完全没动,DeepSeek 只是重新做了一遍后训练(re-post-trained),跑分就翻了超过 7 倍。这不是一次常规的小版本迭代,而是这条赛道里一个越来越清晰的信号:2026 年下半年,后训练阶段能带来的收益,可能已经追上甚至超过了堆参数本身。
这篇文章会把 DeepSeek V4 Flash 到底是什么、这次"最新发布"具体指哪一次版本更新、跑分和 Claude Opus 4.8、GPT-5.6、Kimi K3、GLM-5.2 这些同期热门模型摆在一起对比结果如何、真实定价是多少,以及——对我们这类关注 AI API 中转/代理生态的读者来说最实际的问题——国内中转站现在能不能用、怎么用,一次讲清楚。所有跑分和定价数字均来自 DeepSeek 官方 API 文档、官方更新日志,以及本站此前已核实过的定价数据,凡是第三方来源互相矛盾、无法交叉验证的数字,本文会明确标注,不会为了让对比表格显得"更完整"而编造。
目录
一、DeepSeek V4 Flash 是什么:先说清楚这次"发布"发的到底是什么
先把时间线理顺,因为这次"最新发布"很容易被误读成一个全新模型。2026 年 4 月 24 日,DeepSeek 正式推出 V4 系列,一次给了两档:更大的旗舰 DeepSeek-V4-Pro(1.6T 总参数、49B 激活参数)和更轻量的 DeepSeek-V4-Flash(284B 总参数、13B 激活参数),两者共享 1M token 上下文窗口、最高 384K token 输出长度,权重以 MIT 协议开放在 Hugging Face 上。当时官方给这次发布的定性是"Preview"——预览版,意味着后续还会继续迭代。
真正把 V4 Flash 推向"正式发布"状态的,是 2026 年 7 月 31 日——也就是本文发稿的这一天。DeepSeek 官方 API 更新日志宣布,DeepSeek-V4-Flash API 正式进入公测(Public Beta)阶段,内部构建代号 DeepSeek-V4-Flash-0731。这次更新只针对 V4 Flash:V4 Pro 的 API 和 App/网页端模型都没有变化,仍停留在 Preview 阶段。换句话说,DeepSeek 这次是有意识地先把"小模型"推向成熟,而不是同步升级整条产品线。
更值得玩味的一点是,官方在更新说明里明确写道:0731 构建版本"保持了与 V4-Flash-Preview 完全相同的模型架构和参数规模,只是重新做了一次后训练"(re-post-trained)。API 调用方式完全不变——模型名依然是 deepseek-v4-flash,不需要改任何代码,服务端直接把新权重换了上去。这意味着任何在 4 月就已经接入 deepseek-v4-flash 这个模型 ID 的应用、脚本、中转站,今天起调用到的就已经是升级后的版本,不需要做任何额外配置。
二、架构拆解:284B总参数、13B激活,靠混合稀疏注意力换来的效率
V4 系列(Pro 和 Flash 共享同一套架构设计思路)的核心卖点不是参数堆得有多大,而是"如何用更少的计算量撑起 1M token 上下文"这件事。根据 DeepSeek 官方论文和技术文档,V4 系列引入了三项关键架构改进:
- 混合稀疏注意力(DSA):把 Compressed Sparse Attention(CSA)和 Heavily Compressed Attention(HCA)两种机制交替使用——以 V4-Pro 为例,61 层 Transformer 里前两层用 HCA,后续层则是 CSA 和 HCA 交替。配合 token-wise 压缩,官方给出的效率数字是:在 1M token 上下文场景下,V4-Pro 相比上一代 DeepSeek-V3.2,单 token 推理只需要 27% 的算力(FLOPs),KV Cache 占用只需要 10%。这是"1M 上下文"能做到官方定价这个价位的技术基础,不是靠堆机器硬扛出来的。
- Manifold-Constrained Hyper-Connections(mHC):对传统残差连接(residual connections)的改进,目的是让信息在深层网络里传递得更稳定。
- Muon 优化器:替代常见的 AdamW 类优化器,官方描述其带来"更快的收敛速度和更强的训练稳定性"。
MoE 路由层面,每个 MoE 层由 1 个共享专家(shared expert)和 256 个路由专家(routed experts)组成,每个专家的中间隐藏维度为 2048,每个 token 会激活其中 6 个路由专家。V4-Flash 的 284B 总参数、13B 激活参数,正是在这套路由规则下压缩出来的更轻量版本——总参数量约为 V4-Pro 的六分之一,激活参数量约为四分之一。预训练数据规模方面,官方论文给出的数字是 32 万亿以上高质量 token。
官方对两档模型的定位描述也值得留意:V4-Pro 被描述为"在数学/STEM/编程上超越所有当前开放模型",知识类任务的表现"仅次于 Gemini-3.1-Pro";V4-Flash 则被定位为"推理能力接近 V4-Pro,在基础 Agent 任务上表现相当",换来的是更快的响应速度和更低的调用成本。这也是为什么 V4-Flash 这次单独拿出来做一次后训练升级、且升级幅度如此之大,会成为一件值得单独写一篇文章的事——它不是那个"够用就行"的廉价备胎,而是一个正在被认真投入资源迭代的产品线。
三、从4月24日Preview到7月31日0731正式版:同一个模型,换了一次后训练
把这次更新的"前后对比"数字摆出来,比任何形容词都更有说服力。以下是官方更新日志里公开的、Preview 版本与 0731 版本在同一套 Agent 能力基准上的得分对比:
| 基准 | V4-Flash-Preview(4月) | V4-Flash-0731(7月31日) | 变化 |
|---|---|---|---|
| Terminal-Bench 2.1 | 61.8 | 82.7 | +20.9 |
| DeepSWE | 7.3 | 54.4 | +47.1(约7.5倍) |
| Cybergym | 38.7 | 76.7 | +38.0 |
| NL2Repo | 39.4 | 54.2 | +14.8 |
| Toolathlon-Verified | 49.7 | 70.3 | +20.6 |
除了这五项有明确前后对比的基准,0731 版本还公布了 DSBench-FullStack(68.7)、DSBench-Hard(59.6)、Agent Last Exam(25.2)、Automation Bench Public(25.1)等新增指标,但官方没有给出这几项在 Preview 版本上的对照分数,所以无法计算涨幅,本文也不会替官方去凑一个数字。
DeepSWE 这一项的涨幅尤其值得多说一句:从 7.3 分到 54.4 分,意味着 Preview 版本在这项基准上基本处于"几乎不能用"的水平,而 0731 版本已经是一个能拿出手的分数。官方的解释是这次更新"只是重新做了一次后训练",架构和参数规模都没变——这恰恰说明了后训练/强化学习阶段对 Agent 类任务的影响有多大:同样的底座模型,光靠调整训练数据和训练方法,就能在特定任务类型上实现数量级的提升。这也是 2026 年下半年大模型竞争里一个越来越明显的趋势——"预训练参数规模"作为唯一竞争维度的重要性正在下降,"后训练怎么调"正变得同样关键甚至更关键。
官方更新说明里还提到一句很直接的判断:0731 版本的 Agent 能力"远超"(far exceed)同系列里参数量大得多的 V4-Pro-Preview。也就是说,目前公开可用的版本里,经过这轮重新训练的"小模型" V4-Flash,在 Agent 相关任务上反而比还停留在 Preview 状态、参数量是它 6 倍的"大模型" V4-Pro 更能打。这也解释了为什么 DeepSeek 这次没有选择同步升级两个型号——先把迭代速度更快、成本更低的 Flash 打磨好,再决定 Pro 什么时候跟进,是一个说得通的产品节奏。
另外两项技术细节值得记录:0731 版本原生支持 Responses API 格式(OpenAI 推出的新一代 API 范式,把多轮工具调用、状态管理都收进同一套接口里,逐步取代旧的 Chat Completions),并且专门针对 Codex(OpenAI 的编程 Agent 工具)做了适配。这两点合在一起说明 DeepSeek 这次升级明显是冲着"接入现有 Agent 工具生态"这个具体场景去的,而不只是刷一遍通用能力跑分——一个第三方模型如果只兼容旧的 Chat Completions 格式,接入 Codex 这类原生使用 Responses API 的工具时往往需要额外的适配层去做协议转换,容易在工具调用、流式返回这些细节上出岔子。DeepSeek 直接在模型侧做了原生适配,等于替想用"DeepSeek 底座 + Codex 前端"这套组合的开发者,省掉了这一层转换成本。本站此前在 Codex 中转站配置教程 里也提到过,Codex 走的是 OPENAI_BASE_URL 加自定义端点这套逻辑,原生 Responses API 支持意味着这条链路会更顺。
四、跑分实测:对齐 Claude Opus 4.8、GPT-5.6、Kimi K3、GLM-5.2
跑分涨得猛不代表就追上了顶级闭源模型,这两件事要分开看。目前能找到的、有明确出处的头对头对比数据是:在 Terminal-Bench 2.1 上,Claude Opus 4.8 的得分是 85.0,DeepSeek-V4-Flash-0731 的 82.7 落后约 2.3 分——差距已经相当接近。但在另外两项基准上,差距并不均匀:DSBench-FullStack 上 Opus 4.8 是 71.6,V4-Flash-0731 是 68.7,差 2.9 分,同样接近;但 DSBench-Hard 上 Opus 4.8 是 71.7,V4-Flash-0731 是 59.6,差了 12.1 分,明显被拉开。也就是说,"跟旗舰模型打平"这个说法在部分基准上成立,但在真正困难的任务(DSBench-Hard)上,V4-Flash 和顶级闭源模型之间仍然有实打实的差距,不能一概而论。
再看 V4 系列里更大的旗舰 V4-Pro:在 SWE-bench Verified 上得分 80.6%,和 Gemini 3.1 Pro 的 80.6% 打平,略高于 Kimi K2.6 的 80.2%——这三个数字放在一起,说明目前 SWE-bench Verified 这项编程基准上,头部模型之间的差距已经收窄到 1 个百分点以内,谁"第一"很大程度上取决于具体测试批次。这项数据针对的是 V4-Pro 而非本文主角 V4-Flash,两者不应混为一谈——本文特意分开列出,避免把不同模型、不同基准的数字揉在一起制造误导性的"打平"错觉。
再往外看一层,本站此前测评过的另外两个 2026 年 7 月热门模型也可以放进来做参照:Kimi K3(月之暗面,2.8T 参数,7月16日发布)在 Artificial Analysis Intelligence Index 上得分 57,在其收录的 189 个模型中排名第 4,排在 Claude Fable 5 和两档 GPT-5.6 Sol 推理设置之后,领先于 Claude Opus 4.8、GPT-5.5(xhigh 档)、Claude Sonnet 5 以及 GLM-5.2;SWE-bench Verified 上 Kimi K3 得分 76.8%,低于 DeepSeek-V4-Pro 的 80.6%。这些数字来自 Artificial Analysis、LMArena 等第三方评测机构,方法论公开,本文认为可以放心引用;至于 Gemini 3.5 Flash 的定价,目前能查到的第三方数字彼此差异很大(不同来源给出的输入价从每百万 token 0.15 美元到 1.50 美元不等),无法交叉验证,本文不会为了凑一个"更全"的对比表格而引用这类互相矛盾的数字。
怎么理性看待这轮跑分
"同一套参数重新训练一次、跑分翻7倍"是一个真实且值得关注的信号,但它说明的是后训练方法的进步速度,不等于"V4-Flash 现在已经全面追上顶级闭源旗舰"。在 Terminal-Bench 2.1 这类相对成熟的 Agent 基准上,V4-Flash-0731 已经和 Claude Opus 4.8 处于同一梯队;但在 DSBench-Hard 这类刻意设计得更难的任务上,差距仍然存在。选型时建议按你自己的具体任务类型去看对应基准,而不是被一个笼统的"约等于"结论带着走。
五、定价:把9个当红模型放进同一张表
以下价格均为官方 API 首方定价(非中转站折扣价),部分数字来自 DeepSeek 官方文档,部分来自本站此前已核实并发布过的测评文章,一并列出方便横向对比:
| 模型 | 输入 $/M token | 输出 $/M token | 备注 |
|---|---|---|---|
| DeepSeek V4 Flash | $0.14(缓存命中 $0.0028) | $0.28 | 纯文本,1M上下文,284B/13B激活 |
| DeepSeek V4 Pro | $0.43(缓存命中 ≈$0.0036) | $0.87 | 高峰时段有动态溢价机制(7月中旬起) |
| Qwen3.6-35B-A3B | $0.14 | $0.90 | 支持多模态,V4 Flash不支持 |
| GLM-5.2 | $1.40 | $4.40 | MIT开源权重 |
| GPT-5.6 Luna | $0.20 | $1.20 | 7月30日降价80%后的价格 |
| GPT-5.6 Terra | $2.00 | $12.00 | 7月30日降价20%后的价格 |
| Claude Sonnet 5 | $3.00 | $15.00 | Anthropic中档旗舰 |
| GPT-5.6 Sol | $5.00 | $30.00 | OpenAI旗舰,7月30日价格未变 |
| Claude Opus 4.8 | $5.00 | $25.00 | Anthropic次高档 |
| Claude Fable 5 | $10.00 | $50.00 | Anthropic目前最贵旗舰 |
这张表按输入价格从低到高排列,能看出几个直观的结论:DeepSeek V4 Flash 和阿里 Qwen3.6-35B-A3B 的输入价格并列全场最低(都是 $0.14/M),但 V4 Flash 输出价格($0.28)明显更便宜,前提是你不需要多模态能力——V4 Flash 目前是纯文本模型,看图、读截图、做 UI 还原这类任务它做不了,Qwen3.6 可以。如果拿 V4 Flash 直接和金字塔顶端的 Claude Fable 5 比,输入价格差了约 71 倍,输出价格差了约 178 倍——这个差距不是"打折"级别,而是量级上的差异。
另外值得单独说明的是 DeepSeek V4 Pro 的"高峰期动态溢价"机制:从 7 月中旬开始,V4 Pro 在服务器负载高的时段会上浮价格,这是 DeepSeek 管理热门模型算力容量的方式。V4 Flash 目前没有这套机制,定价始终恒定,这也是很多预算敏感场景选择 Flash 而非 Pro 的另一个实际理由——不只是因为便宜,也因为账单可预测。
真实调用示例——DeepSeek 官方 API 兼容 OpenAI 格式,也可以通过 /anthropic 路径兼容 Anthropic 协议接入 Claude Code:
curl https://api.deepseek.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash",
"messages": [{"role": "user", "content": "Hello!"}]
}' 六、为什么偏偏是7月31日:价格战和资本市场的双重背景
把这次更新放到时间线里看会更有意思。就在 DeepSeek 公布 0731 版本的前一天(7月30日),OpenAI 刚宣布把 GPT-5.6 系列里两档较低成本模型的价格砍掉一大截——Luna 输入/输出价格从 $1/$6 降到 $0.20/$1.20,降幅 80%;Terra 从 $2.50/$15 降到 $2/$12,降幅 20%;旗舰 Sol 价格保持不变。OpenAI 把这次降价归因于内部效率提升,但分析普遍认为,这和企业客户对 AI 支出回报率的疑虑、以及中国低价开源模型带来的竞争压力脱不开关系。DeepSeek 紧接着次日就把自己最便宜的模型也做了一次大幅能力升级——虽然价格数字本身没有变化,但相当于用同样的钱买到了明显更强的 Agent 能力,效果上和降价是同一个逻辑。
更大的背景是整个行业的资本开支正在同步狂飙:就在同一周,微软公布 2026 财年第四季度财报,Azure 营收增速加快到 43%,公司同时把 2027 财年资本开支指引大幅上调至 2550 亿至 2600 亿美元;亚马逊同期公布的第二季度财报里,AWS 增速加快到 37%、创近 18 个季度新高,CEO 安迪·贾西表示公司 AI 与芯片两项业务的年化营收已"各自突破 250 亿美元";Meta 则把全年资本开支指引下限上调至 1300 亿美元,但因为投入激增导致利润不及预期,财报公布后股价盘后一度下跌近 8%。三家美国科技巨头一边把资本开支往上调到历史新高,一边在利润端开始承受市场的质疑——这恰恰是 DeepSeek 这类"用更少计算量做更多事"的效率型打法最有说服力的时间点:当算力本身越来越贵、投资人对"AI 支出何时兑现回报"越来越没耐心,一个能把 1M 上下文的推理成本压到官方定价这个量级的模型,故事会讲得比"再堆一批 GPU"更容易让人信服。
再往资本市场看一层:据路透社 7 月 20 日援引知情人士报道,DeepSeek 正筹备新一轮融资,目标估值约 5000 亿元人民币(约 740 亿美元),计划最多筹集 500 亿元人民币,为年内可能启动的 A 股 IPO 程序做准备——这将是继 2026 年 6 月完成的 74 亿美元融资轮(彼时估值约 4500 亿元人民币)之后的又一轮增资。同期,彭博亿万富翁指数显示,DeepSeek 创始人梁文锋的身家在一周内从约 167 亿美元跃升至 360 亿美元,超过 Anthropic 联合创始人 Dario Amodei 和 OpenAI 联合创始人 Greg Brockman,成为全球 AI 模型创始人中身家最高者。这些数字合在一起说明一件事:DeepSeek 在 2026 年已经不只是一个"便宜的开源替代品",而是一个正在被资本市场认真定价、准备走向公开市场的头部玩家,V4 Flash 这次升级也应该放在这个背景下理解——它既是技术迭代,也是这家公司在 IPO 前持续证明自己产品竞争力的动作之一。
七、国内中转站怎么接入:这是本站读者最该关心的一节
先说最重要的一个技术细节:这次 0731 升级没有改变模型 ID,调用端依然是 deepseek-v4-flash,DeepSeek 只是在服务端把权重换成了重新训练后的版本。这意味着任何此前已经在支持列表里列出 deepseek-v4-flash 的中转站,理论上今天起转发的请求就已经自动命中新版本,不需要中转站方做任何配置改动——这也是模型服务商在云端做"原地升级"(in-place upgrade)的常见方式,本站此前在 DeepSeek 模型 ID 迁移那篇文章里也提到过类似逻辑(旧 ID deepseek-chat/deepseek-reasoner 已于 7 月 24 日退役,统一迁移到 deepseek-v4-pro[1m] 和 deepseek-v4-flash)。
需要提醒的是,"自动命中新版本"是基于中转站直接转发到 DeepSeek 官方接口这个前提成立的——如果某个中转站是把模型权重下载到自己的推理集群上自行托管(而不是纯转发官方 API),版本更新就需要中转站自己手动跟进,具体以各家公告为准,本文不替任何一家中转站做这个承诺。
从本站已核实的供应商信息看,DeepSeek 官方平台(platform.deepseek.com)本身就是调用 V4 系列模型最直接的入口,国内可直连,无需科学上网。同时,多家已在本站 AI API 中转站对比 收录的供应商已把 DeepSeek V4 系列纳入模型覆盖范围,包括硅基流动(SiliconFlow)、老张API、YKH.AI、FlowBar、UiUiAPI 等——具体价格、并发限制以各家最新公告为准,选型时建议重点核对两点:一是是否明确支持 deepseek-v4-flash 这个模型 ID(而非仍停留在旧的 deepseek-chat),二是是否同时支持 OpenAI 格式和 Anthropic 格式(后者决定了能不能直接接 Claude Code)。真实海外聚合平台 OpenRouter 上也能查到 DeepSeek V4 Flash 的条目,同时挂着多家第三方推理服务商,价格因供应商而异,部分低于官方定价,这也是海外聚合类中转的常见模式——多家算力提供方竞价,用户可以按价格、速度或稳定性选择路由策略。
如果你已经在用 LiteLLM 或 Claude Code Router 之类的网关方案做多模型混用,接入方式和之前完全一样,只需要把子 Agent/低复杂度任务的模型指向更新后的 deepseek-v4-flash 即可,不需要额外改动:
model_list:
- model_name: deepseek-v4-flash
litellm_params:
model: openai/deepseek-v4-flash
api_base: https://api.deepseek.com
api_key: os.environ/DEEPSEEK_API_KEY
更完整的接入步骤(申请 Key、配置环境变量、Claude Code 迁移避坑清单)可以直接参考本站已发布的 Claude Code 切换 DeepSeek 完整指南 和 LiteLLM 完整教程,两篇文章里的配置示例本身就已经在用 deepseek-v4-flash 这个模型 ID,本次升级不需要改动任何一行配置。
八、谁该用、谁不该用
- 高频、低复杂度的批量任务(内容摘要、数据提取、简单问答、代码补全、Claude Code 的子 Agent/快速任务)→ V4 Flash 目前的性价比在同类模型里几乎找不到对手,直接用。
- 需要处理图片/截图/设计稿的 Agent 工作流 → V4 Flash 是纯文本模型,做不了,需要多模态能力的话应该考虑 Qwen3.6-35B-A3B 或其他支持视觉的模型。
- 预算敏感但又需要 V4 系列更强推理能力的场景 → 权衡 V4 Pro 的高峰溢价机制,非高峰时段调用,或者干脆把复杂任务留给 Pro、简单任务分流给 Flash,两档搭配用。
- 对"追上顶级闭源旗舰"有硬性要求的困难任务(比如 DSBench-Hard 这类场景)→ 目前的数据显示 V4-Flash 和 Claude Opus 4.8 之间仍有实打实差距,不建议把它当作 1:1 平替。
- 国内团队、已经在用中转站接入其他模型的开发者 → 优先确认中转站是否已经更新到新的模型 ID,同时留意是纯转发官方接口还是自建托管,这决定了你能不能自动吃到这次升级。
九、结论
DeepSeek V4 Flash 这次"最新发布",本质上不是一个全新模型的登场,而是同一个 284B/13B 激活参数的 MoE 模型,经过一次重新训练,在 Agent 相关跑分上实现了数量级的提升——DeepSWE 从 7.3 涨到 54.4,Terminal-Bench 2.1 从 61.8 涨到 82.7,涨幅之大足以让它在部分基准上追平参数量是它 6 倍的自家旗舰 V4-Pro,甚至逼近 Claude Opus 4.8。定价上,它维持着 $0.14/$0.28 每百万 token 的官方价格,在同期所有主流模型里处于价格底部区间,但代价是不支持多模态,且在真正困难的任务上和顶级闭源模型仍有明显差距。
合在一起看,这意味着
如果你的场景是高频、低复杂度、纯文本的批量任务,V4 Flash 目前的性价比几乎没有对手;如果你的场景需要多模态或者对疑难任务的绝对准确率有硬性要求,它还不能替代顶级闭源旗舰模型。
- 预算敏感、任务偏批量 → 直接换,模型 ID 不变,中转站大概率已经自动升级。
- 需要看图/多模态 → V4 Flash 目前做不到,考虑 Qwen3.6-35B-A3B 或多模态旗舰。
- 国内开发者 → 记住一句话:模型 ID 没变,中转站转发官方接口的情况下大概率已经自动吃到升级,具体以你所用中转站的实际响应为准。