2026 年 8 月 22 日,律动 BlockBeats 报道:DeepSeek 为其 V4-Flash 模型推出了视觉版本 V4-Flash-Vision-Exp,并公布了首批面向 Agent 的基准成绩——在 4 项多模态 Agent 评测中和 Anthropic 的旗舰 Claude Opus 4.8 打成 2:2。这不是一个全新的旗舰模型,而是把"眼睛"装到了 V4 Flash 这头"走量主力"身上。对国内 AI API 中转站生态来说,这件事最值得关注的点在于:如果视觉版沿用了 V4 Flash 的峰谷电价(非高峰 ¥1.5/¥4.5、高峰 ¥3/¥9 每百万 token),它就会成为市场上最便宜的"能看懂截图与 UI 稿"的多模态 Agent 模型之一。本文从定位、规格、跑分、定价、中转站接入现状五个维度拆开它,并明确标注哪些数字已核实、哪些尚未核实。

先交代本文的事实纪律与时效基准。本文信息核实截至 2026 年 8 月 22 日。跑分数字转述自律动 BlockBeats 对 DeepSeek 官方发布口径的整理,均为 DeepSeek 官方自测(self-reported),不是第三方独立榜单,本文按"官方宣称"处理并明确标注。V4 Flash 基础版的架构(284B/13B 激活 MoE、DSA 混合稀疏注意力、1M 上下文)与峰谷电价,沿用本站此前已核实并发布的数据(deepseek.md 供应商页,lastVerified 2026-08-15;官方峰谷电价自 2026-08-16 16:00 UTC 生效)。视觉版的具体模型 ID、以及它是否单独对视觉输入计价,截至发稿尚未在官方文档中核实到公开的独立条目——凡是无法交叉验证的数字,本文会直接说"未核实",不会为了让表格好看而编造。

一、发布与定位:这不是新模型,是 V4 Flash 的多模态扩展

先说清楚 V4-Flash-Vision-Exp 在 DeepSeek 产品线里的位置,因为这决定了后面所有比较的坐标。DeepSeek 的 V4 系列目前分两档:V4 Flash(走量主力,284B/13B 激活 MoE)与V4 Pro(旗舰,1.6T/49B 激活 MoE)。V4 Flash 自 7 月 31 日从 Preview 升级到 0731 正式公测版后,一直是一个纯文本模型——本站 7 月底的深度测评里就明确写过:它做不了看图、读截图、UI 还原这类任务,需要多模态的话当时建议去用 Qwen3.6-35B-A3B。这次 V4-Flash-Vision-Exp,就是来补上这块短板的。

名字里的三个部分值得逐一拆开。"V4-Flash"说明基座是 V4 Flash 这一档,不是新的旗舰;"Vision"说明新增的是视觉/图像输入能力;"Exp"(Experimental)说明这是一个实验性变体,不是稳定的正式版——按 DeepSeek 的习惯,实验版会先给开发者试用,再视反馈决定是否转正(0731 就是 Preview→公测的同类路径)。从现有信息看,它的定位是"在 V4 Flash 的低价基座上,把多模态 Agent 能力补上",而不是"再造一个比 Pro 更强的旗舰"。这和谷歌把 Flash 档当主战场、把多模态输入下放到 Flash 档的打法,逻辑是相通的:旗舰负责立品牌,Flash 负责抢开发者与走量,而"能看图"正在从旗舰的专属卖点变成走量档的标配。

这里有一个值得注意的信号。DeepSeek 在 8 月中旬刚给 V4 系列上了峰谷电价(非高峰半价),目的就是用"错峰降价"把批量负载往非高峰引导、平抑算力压力。现在又在同一个月内放出视觉版——它显然并不满足于"纯文本的最便宜",而是想在同一价位带里,把"便宜 + 多模态 + Agent"三个标签一起占住。对中转站读者来说,这意味着:如果你一直因为 V4 Flash 不能看图而被迫去用更贵的多模态模型,视觉版很可能是一个值得等的"平价眼睛"。

二、规格与能力:284B/13B MoE + 1M 上下文,加上"眼睛"

先摆基础版的硬规格(这些是本站此前已核实的 V4 Flash 0731 公测版数据):284B 总参数 / 13B 激活参数的 MoE,DSA(混合稀疏注意力)架构,约 1M token 上下文,纯文本输入输出。V4-Flash-Vision-Exp 目前官方没有公布新的参数规模,按照 DeepSeek 对待实验版的一贯做法(0731 就是"架构一个字节没动、只重跑后训练"),视觉版大概率是在同一套 284B/13B 基座上追加了视觉编码与多模态对齐训练,而不是重新训练一个大得多的模型——但这属于合理推断,官方未明确说明,本文标注为推断。

能力层面的变化集中在"输入模态"上:视觉版增加了图像/截图/UI 稿/图表/扫描件等视觉输入的理解能力。这对 Agent 场景是实打实的补强——过去 V4 Flash 驱动的 Agent 只能读文字描述,遇到"看这张报错截图""按这个 UI 稿改前端""识别这张图表里的数据"这类任务就无能为力;视觉版把这些任务纳入了它能处理的范围。需要说明的是,官方公布的是"视觉输入"(vision input),没有提图像生成/视频理解等能力,输出仍是文本——它定位是"能看懂的多模态 Agent 模型",不是"能画图的生成模型"。

一个对中转站读者很关键的规格问题:上下文长度与输出长度是否与基础版一致。由于视觉 token 通常会占用额外上下文(一张图可能折算成几百到上千 token),视觉版在 1M 上下文下实际能容纳的文本长度,可能比纯文本版略受影响——但这个细节官方没有给数据,本文不臆测具体数字,只提醒:接入后先实测一次"长文档 + 图片混排"的上限,再上生产。

三、跑分:首个 Agent 基准,4 项多模态评测 2:2 打平 Opus 4.8 怎么读

这一节需要打起精神,因为这里最容易踩坑:以下所有跑分均为 DeepSeek 官方自报口径(转述自律动 BlockBeats 的报道),截至发稿尚无大规模第三方独立复测。本文把它们当作"官方宣称"来转述,不当作独立事实。

官方公布的首批 Agent 基准,是与 Anthropic 旗舰 Claude Opus 4.8 对比的 4 项多模态 Agent 评测,结果 2:2 打平:

多模态 Agent 基准V4-Flash-Vision-ExpOpus 4.8胜者
Agents' Last Exam27.325.7DeepSeek
ZeroBench35.034.0DeepSeek
ApexBench36.539.4Opus 4.8
Chartography64.365.0Opus 4.8

换句话说:DeepSeek 在 Agents' Last Exam(27.3 vs 25.7)和 ZeroBench(35.0 vs 34.0)两个评测上小幅领先,Anthropic 在 ApexBench(36.5 vs 39.4)和 Chartography(64.3 vs 65.0)上小幅领先。四个数字的差值都在 1~3 分以内——与其说"打平",不如说"在统计噪声范围内难分伯仲"。这本身就是一个值得注意的信号:一个走量档、284B/13B 激活的模型,在官方口径下追到了旗舰 Opus 4.8 的身位。但请务必记住:这是官方自测,且各厂商自报口径与方法论不同,横向比较要格外小心。

更关键的对比是"加了眼睛之后进步了多少"。官方同时给了相对纯文本版 V4-Flash-0731 的变化:

基准V4-Flash-0731(纯文本)V4-Flash-Vision-Exp变化
ApexBench26.236.5+10.3pp
Agents' Last Exam25.227.3+2.1pp
DeepSWE(文本 Agent)54.459.3+4.9pp

这个表有两个读法。第一,视觉输入对"看屏幕/操作界面"类 Agent 任务的提升是质的:ApexBench 从 26.2 跳到 36.5,涨了 10 个点,这正是"能看到截图/UI 之后,Agent 能真正操作图形界面"的直接体现——这类任务纯文本模型本来就做不了,所以涨幅最大。第二,文本 Agent 能力不但没被拖累,反而稳中有升:官方称 7 项文本评测里 6 项领先纯文本版,其中 DeepSWE 从 54.4 升到 59.3,甚至超过 Opus 4.8 的 58.0。这意味着视觉对齐训练没有牺牲编码能力,反而像 0731 那次重训练一样,又顺手把文本 Agent 能力往上推了一截。

怎么理性看待这轮跑分

官方自报的"2:2 打平 Opus 4.8"说明"视觉版把 V4 Flash 的多模态 Agent 能力拉到了接近旗舰的水平",这是可信的方向;但它不能替代第三方统一口径。ApexBench +10.3pp、DeepSWE 54.4→59.3 是"加入视觉后确实变强了"的有力证据;而"打平 Opus 4.8"是厂商口径,需要等 Artificial Analysis、LMSYS 这类第三方榜单更新后再对照。把"官方自报"和"第三方榜单"当成两套数据并存,别混着用,是这篇文章最想传达的一条。

四、定价:视觉输入会不会单独计价?峰谷电价下成本怎么算

定价是视觉版对中转站读者最实际的部分。先看基础版 V4 Flash 当前生效的官方价目(自 2026-08-16 16:00 UTC 起,DeepSeek 对 V4 系列实行高峰/非高峰双档计价,每百万 token):

档位输入 ¥/M输出 ¥/M约合 USD
非高峰(约半价)¥1.5¥4.5$0.22 / $0.66
高峰¥3¥9$0.44 / $1.32

高峰时段为每天 01:00–04:00 与 06:00–10:00(UTC)。作为对比,峰谷电价生效前,V4 Flash 官方价格是 $0.14/$0.28 每百万 token(输入/输出)——也就是说,非高峰价相对旧价大约涨了 57%(输入),但比高峰价便宜一半。对预算敏感的任务,错峰调用仍然是压成本的第一杠杆。

那么视觉版呢?这里必须诚实:截至发稿,官方文档没有单独发布 V4-Flash-Vision-Exp 的独立价目,视觉输入是否单独计价、是否沿用峰谷电价,均未核实。基于两点合理推断(而非已核实事实):第一,大概率沿用 V4 Flash 的峰谷电价——实验版通常先在走量档的计价框架里跑,单独开一个新价格带反而增加迁移成本;第二,视觉输入可能按 token 折算进输入价,而不是按"张"另收费——这是 OpenAI 兼容生态里图像输入的主流做法(图片编码成 image token 计入输入)。但这两点都需要你以官方 API 文档为准,本文不作断言。

算一笔账,让"视觉版如果同价"更直观。假设你要做一个"看 UI 稿改前端"的 Agent 任务:输入包含一张 UI 截图(折算约 1000 token)+ 2 万 token 的代码上下文,输出约 1 万 token。按非高峰价 ¥1.5/¥4.5 计算:输入约 ¥0.03,输出约 ¥0.045,单任务合计不到 ¥0.08;就算按高峰价 ¥3/¥9,也就 ¥0.16 左右。这个量级,是当前"能看图"的闭源多模态模型(通常输入 $1/M 起、输出 $5–15/M)完全给不出的成本曲线。如果视觉版真按这个价位走,它会对"截图理解 + Agent 自动化"这类高调用量场景形成降维打击。

五、中转站接入现状:谁已经在卖 deepseek-v4-flash-vision

对国内读者来说,最实际的问题是:视觉版能不能通过中转站用上?这里先说一个诚实的现状:截至本文发稿(2026-08-22),本站收录并核实的 153 家 AI API 供应商中,没有任何一家的模型清单里明确列出 deepseek-v4-flash-vision 或视觉版的模型 ID。这完全符合预期——视觉版是当天发布的实验变体,中转站从"官方放量"到"自家控制台上架"通常需要数小时到数天。所以你现在去各中转站控制台大概率还搜不到它;这篇文章能给你的,是"谁最可能最先上架"以及"上架后大概卖多少钱"的判断。

从本站收录数据看,有三类中转站最可能抢到视觉版的"首发":第一类是宣称新模型同步快的站,如 ProAI API(proaiapi.tech,其定价说明明确写"新模型同步快:grok-4.6/gemini-3.7-flash/qwen3.8-max 已上线",lastVerified 2026-08-16)与硅基流动(SiliconFlow,宣称 DeepSeek 系列"更新速度与官方几乎同步",lastVerified 2026-08-11);第二类是模型覆盖特别广的大目录站,如 NoDAPI(545+ 模型)、JENIYA(454+ 模型)、MKEAI(lastVerified 均 2026-08-16),它们的 DeepSeek 覆盖都在 V4 Flash/Pro 两档,加一个视觉版只是加一行;第三类是DeepSeek 系低价走量站,如 RunAPI、4SAPI、302AI、AIHubMix 等,只要官方放量,它们跟进速度通常也很快。需要特别提醒:这些是"最可能",不是"已上架",选型时请以各中转站控制台实际列出的模型与价格为准,充值前先小额测试。

模型 ID 方面,官方基础版用的是 deepseek-v4-flash(历史别名 deepseek-chat 已于 7 月 24 日退役);视觉版的官方模型 ID,本文能确认的只有报道里的产品名 V4-Flash-Vision-Exp,具体 API 模型 ID(可能是 deepseek-v4-flash-vision、deepseek-v4-flash-vl 或类似变体)截至发稿未在官方文档核实。中转站上架时通常会照抄官方 ID,但也不排除个别站用自定义别名(如 deepseek-v4-flash-vision-exp 或 deepseek/deepseek-v4-flash-vision)。接生产前,请以官方 API 文档和各中转站控制台的模型列表为准,别因为本文写了某个 ID 就直接上流量。

六、价格对比:各中转站基础版 V4 Flash 报价参考与视觉版预期

由于视觉版还没有任何中转站单独报价,下面这张对比表给的是各中转站对基础版 deepseek-v4-flash 的当前报价(均为本站收录时核实的公开数据,标注了各自核实日期),作为"视觉版上架后大概卖多少钱"的参考基准。中转站行业对同一模型的不同变体通常沿用同一套单价(视觉版只是输入多算点 image token),所以这份基础版报价,就是你能预期的最接近的参考线。

平台输入 ¥/M输出 ¥/M说明(核实日期)
DeepSeek 官方(非高峰/高峰)¥1.5 / ¥3¥4.5 / ¥9峰谷电价,2026-08-16 起生效(已核实)
硅基流动 SiliconFlow¥1.00¥2.00缓存 ¥0.02;2026-08-11 核实,早于峰谷电价,可能已更新(未复核)
RunAPI约 ¥0.77约 ¥1.542026-08-15 核实;汇率约 ¥6.75–6.79/$1(已核实)
OpenRouter约 $0.068(≈¥0.46)约 $0.168(≈¥1.14)2026-08-11 核实;聚合多路供应商,价随路由浮动(已核实)
4SAPI / 302AI / AIHubMix / FlowBar——模型清单含 deepseek-v4-flash,具体价以控制台为准(未给出单价)

这张表能读出几个关键结论。第一,中转站价格普遍低于官方非高峰价:硅基流动 ¥1.00 输入比官方非高峰 ¥1.5 还便宜三分之一,RunAPI ¥0.77、OpenRouter 折合约 ¥0.46 更是明显低于官方——这与本站此前的横评结论一致,中转站对 DeepSeek 这类走量模型通常有"折扣 + 汇率"双重价差。第二,视觉版即使沿用这套价格,也远低于任何"能看图"的闭源多模态模型:即使按最高的官方高峰价 ¥3/¥9 算,也只要 Claude/GPT 视觉模型的一个零头。第三,峰谷电价对视觉版同样重要:如果视觉输入按 token 计费,错峰调用省的钱在"看图"场景下会被放大——因为截图 token 会推高输入占比,而输入恰恰是峰谷价差最明显的一档。

必须再次强调的诚实标注:上表中的硅基流动、OpenRouter 报价核实于 2026-08-11,早于官方峰谷电价生效日(08-16),它们是否已跟随官方调整、是否已上架视觉版,均未复核;RunAPI 核实于 08-15,同样在峰谷电价生效前。视觉版的任何中转站报价,本文一律视为"尚未出现",等各站上架后再更新。你在读到时,请以各站控制台实时价为准。

七、接入方式:OpenAI 兼容代码与模型 ID 注意点

视觉版的接入方式与本站此前写过的所有 OpenAI 兼容中转完全一致,区别只在模型 ID 和输入消息里多一个图片字段。以 OpenAI SDK 为例(模型 ID 暂以 deepseek-v4-flash-vision 作示例,实际以官方文档为准):

from openai import OpenAI

client = OpenAI(
    api_key="你的中转站API Key",
    base_url="https://你的中转站域名/v1"  # 以各中转站控制台实际地址为准
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision",  # 以官方文档为准
    messages=[
        {"role": "system", "content": "你是一个前端工程师,根据截图给出修改方案"},
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "请分析这张 UI 截图并给出改进建议"},
                {"type": "image_url", "image_url": {"url": "https://example.com/ui.png"}}
            ]
        }
    ],
)
print(response.choices[0].message.content)

如果你用 LiteLLM / 网关类聚合层,逻辑也一样,把 model 指向视觉版即可:

model_list:
  - model_name: deepseek-v4-flash-vision
    litellm_params:
      model: deepseek/deepseek-v4-flash-vision
      api_key: os.environ/DEEPSEEK_API_KEY

务必提醒:deepseek-v4-flash-vision 只是本文的示例 ID,不是已核实的官方模型 ID。 视觉版刚发布几个小时,官方 API 文档很可能还没更新模型列表;中转站更不可能这么快上架。在你读到这篇文章时,正确的流程是:先打开 DeepSeek 官方 API 文档确认模型 ID,再逐个核对各中转站控制台,最后小额充值实测"图片输入能否通"——视觉模型最怕的就是中转站只透传了文本通道、图片字段被静默丢弃。接生产前,先用一张图 + 一段文字实测,确认返回的不是"忽略图片后的纯文本回答"。

八、选型结论:什么场景等它,什么场景别等

  • 截图/UI 稿/图表理解类 Agent 任务 + 预算敏感 → 这是视觉版的甜点位。如果你现在为了"看图"被迫用 $1/M 起的闭源多模态模型,等视觉版上中转站后,成本可能降到十分之一量级。先小额实测图片通道是否透传。
  • 纯文本批量任务 → 不用等视觉版,基础版 deepseek-v4-flash 已经足够,且价格最低、生态最成熟。
  • 需要最强多模态旗舰智能 → 别拿实验版碰旗舰。视觉版在官方口径下与 Opus 4.8 打平,但那是自测口径,且涉及图形界面深度操作的 ApexBench 仍落后;对疑难任务有硬性准确率要求的,还是等第三方榜单更新后对比。
  • 上生产前必须验证的三件事 → ① 官方与中转站的模型 ID 是否一致;② 图片输入是否真的被处理(而非静默忽略);③ 峰谷电价与视觉 token 折算后的实际账单。

九、结论:视觉版真正的信号是什么

DeepSeek V4-Flash-Vision-Exp 是一个"实验版",但它放出的信号比实验版的身份更重要。真正值得记住的,是下面三条。

第一,"便宜的多模态 Agent"开始成为现实。 V4 Flash 走量档 + 峰谷电价(非高峰 ¥1.5/¥4.5)本来就是全场最低价之一,现在加上视觉输入,它在官方口径下追到了 Opus 4.8 的身位(2:2)。如果视觉版沿用这套价格,"能看懂截图的 Agent 模型"的成本天花板,会被一次性压低一个数量级——这是比任何单次跑分都更有结构意义的改变。第二,视觉输入对 Agent 能力的提升是真实的:ApexBench 26.2→36.5 说明"看到屏幕"直接转化成了"能操作界面"的能力增量,文本 Agent 能力(DeepSWE 54.4→59.3)还顺势涨了一截。但第三,所有跑分都是官方自测,且视觉版还在实验期:模型 ID 未定、视觉输入是否单独计价未定、中转站无一上架。在你读到本文时,请以官方 API 文档和各中转站控制台为准——先确认 ID,再小额实测图片通道,再谈放量。

最后给中转站读者一句总结:视觉版是 2026 年 8 月里"最值得等的平价多模态入口"。它不需要你现在就动手接(事实上也还接不到),但它值得你把它加进观察清单——一旦硅基流动、ProAI API、NoDAPI 这类同步快的站上架 deepseek-v4-flash-vision 且价格沿用基础版,它就会成为截图理解、UI Agent、文档多模态解析这些高调用量场景里,性价比最极端的那一个选择。

合在一起看,这意味着

  • 视觉版是什么 → V4 Flash(284B/13B MoE、1M 上下文)的多模态扩展,实验版,新增图像输入,输出仍为文本。
  • 跑分 → 官方自测,4 项多模态 Agent 评测 2:2 打平 Opus 4.8;ApexBench 26.2→36.5、DeepSWE 54.4→59.3。第三方复测待更新。
  • 定价 → 官方独立价目未公布,大概率沿用 V4 Flash 峰谷电价(非高峰 ¥1.5/¥4.5、高峰 ¥3/¥9);视觉输入是否单独计价未核实。
  • 中转站 → 截至发稿 153 家收录供应商无一明确上架视觉版;硅基流动/ProAI API/NoDAPI/JENIYA 等同步快的站最可能先行,接生产前务必实测图片通道。