全部模型

Okou上的DeepSeek V4 Flash:最低价格档就能跑智能体级编码

DeepSeek开放权重的2840亿参数混合专家模型,每个token激活130亿。0731版本在DeepSeek公布的每一项智能体基准测试上都超过V4 Pro,价格为每100万token输入0.14美元、输出0.28美元。

1M tokens · Text / Code · Prompt cache

DeepSeek V4 Flash是DeepSeek V4这一代里主打效率的那一半:2840亿参数的混合专家模型,每个token激活130亿参数,以MIT许可证开放权重发布。2026年7月31日发布的0731版本没有改动架构,只是用智能体数据重跑了一遍后训练,结果在DeepSeek公布的全部九项智能体基准测试上都超过了DeepSeek V4 Pro(Preview)——Terminal-Bench 2.1是82.7对72.1,DeepSWE是54.4对12.8。

服务商标价为每100万token输入0.14美元、输出0.28美元,缓存命中部分每100万token收0.0028美元,缓存写入不收费,这让它成为Okou当前阵容里最便宜的推理模型。它带有100万token的上下文窗口、最多384K的输出,思考模式默认开启。它只处理文本,没有视觉能力。某个环节需要图像或Claude Code框架时就用Claude Sonnet 4.6,想要OpenAI家族里的便宜档则用GPT 5.6 Luna。

DeepSeek V4 Flash是什么?

2026年7月31日(DeepSeek-V4-Flash-0731,公测版) · DeepSeek V4家族里主打效率的一半:每个token激活130亿参数,V4 Pro是490亿,后训练专为智能体任务而做。

DeepSeek V4 Flash最早出现在2026年4月24日,是V4家族里较小的那一半——2840亿参数的MoE模型,每个token激活130亿,上下文窗口100万token,旁边是1.6万亿参数的V4 Pro。它在2026年7月31日以DeepSeek-V4-Flash-0731的名义结束预览,这个公测版本没有动架构,只重跑了后训练这一步,这次用的是带智能体味道的数据。

这次重训就是整个发布的全部看点。按DeepSeek自己的数据,0731版本在公布的全部九项智能体基准测试上都超过V4 Pro(Preview),而激活的参数大约只有后者的四分之一:Terminal-Bench 2.1从Flash预览版的61.8涨到82.7,DeepSWE从7.3涨到54.4,Toolathlon-Verified从49.7涨到70.3。其中好几项已经逼近Claude Opus 4.8——Terminal-Bench 2.1是82.7对85.0,Agents' Last Exam是25.2对25.7——而价格只是零头。

需要把话说清楚的地方也有。每个分数都是DeepSeek自己报的,跑在尚未公开的DeepSeek Harness上,所以没有任何一项经过独立复现,九套测试里还有两套是DeepSeek的内部测试集。这个模型只处理文本,在研究生水平的推理上落后于前沿,在长周期多步骤任务上也仍不及V4 Pro。思考模式默认开启,思考产生的token按输出计费。

DeepSeek V4 Flash有什么特别之处

架构与能力上的主要亮点。

V4 Flash是稀疏混合专家模型:总参数2840亿,每个token激活130亿;每个MoE层有1个共享专家和256个路由专家,中间维度为2048,每个token触发6个路由专家。前三个MoE层使用哈希路由,多token预测深度为1。公开的0731检查点是3040亿参数,因为它在2840亿的基座之上还带了一个投机解码的草稿模块。它支持100万token的上下文窗口、最多384K的输出,支持思考与非思考两种模式,以及带lowhighmax三档的reasoning_effort参数。权重采用MIT许可证,无需申请即可获取。

规格速览

家族DeepSeek V4系列(Flash)
参数总计2840亿,激活130亿(MoE)
模态文本、代码(无视觉)
许可证MIT,开放权重
提示词缓存支持(DeepSeek)
上下文窗口100万token
最大输出最多384K token
推理强度Low / High / Max
服务商标价每100万token输入0.14美元、输出0.28美元

DeepSeek V4 Flash基准测试

数据由DeepSeek自行公布,来自DeepSeek-V4-Flash-0731模型卡,用DeepSeek Harness的minimal模式在最高推理强度下运行(temperature 1.0,top_p 0.95)。该Harness尚未发布,所以没有一项经过独立复现,DSBench-FullStack和DSBench-Hard则是DeepSeek的内部测试集。

Terminal-Bench 2.1智能体终端任务;V4 Pro(Preview)为72.1
82.7
SWE-bench Verified预览版本,服务商自报
79.0%
Cybergym服务商自报
76.7
Toolathlon (verified)工具使用;V4 Pro(Preview)为55.9
70.3
DSBench-FullStackDeepSeek内部测试集
68.7
DSBench-HardDeepSeek内部测试集
59.6
DeepSWE从预览版本的7.3提升而来
54.4
NL2Repo代码仓库构建
54.2
Agents' Last ExamClaude Opus 4.8为25.7
25.2

DeepSeek V4 Flash价格

服务商标价,按每100万token计。

输入$0.14
输出$0.28
缓存读取$0.003
缓存写入不计费

DeepSeek V4 Flash实际用起来怎么样

来自生产环境智能体运行的实际观察。

智能体执行

0731的后训练瞄准的正是这件事:驱动终端、按顺序调用工具、不用人插手就把任务做完。Terminal-Bench 2.1的82.7和Toolathlon-Verified的70.3,放在这个价位上已经是前沿水准。

成本表现

每100万token输入0.14美元、输出0.28美元,缓存命中每100万token只要0.0028美元,缓存写入完全不计费。这是当前阵容里最便宜的位置,输出价格大约是V4 Pro的三分之一,所以量大的活儿都该交给它。

长上下文

输入100万token,输出最多384K,整个代码仓库的通读和超长的记录都不用分块。只是在长周期、多步骤的智能体循环上,质量仍不及V4 Pro。

推理深度

lowhighmax三档reasoning_effort在延迟和深思之间做取舍,DeepSeek公布的分数全部跑在max档。研究生水平的推理不是它的长项,那是Claude Opus 5和GPT 5.6 Sol更领先的地方。

模态

只有文本和代码。流程里只要出现截图、扫描版PDF或图表,就需要Claude Sonnet 4.6或GPT 5.6 Luna这样的视觉模型。

DeepSeek V4 Flash最适合的智能体任务

高频运行的编码智能体

批量PR评审、写测试、lint加修复、定时重构——同一个智能体一天要跑上百次。输出每100万token只要0.28美元,单次成本低到量不再是限制。

终端与工具驱动的自动化

0731版本公布的最强成绩就在终端任务和工具使用上,而修构建、查部署、排日志的智能体整天干的正是这些。

通读整个代码仓库

100万token的窗口能一次装下一个中等规模的代码仓库、一条很长的事故时间线或一整套设计文档,做迁移或审计的智能体可以对着全局推理,不必一块一块地看。

前沿编排模型下面那层便宜的执行层

让Claude Opus 5或GPT 5.6 Sol负责规划和复核,把读文件、跑命令、写补丁这些机械步骤交给V4 Flash。只有决定这次运行成败的那几步,才按前沿模型的价格付费。

什么时候不该用DeepSeek V4 Flash

流程里有图像就别用V4 Flash,它没有视觉能力;研究生水平的推理也别用,前沿模型在那里仍然明显领先。需要连续几个小时保持连贯的长周期运行,还是V4 Pro和Claude Opus的地盘。另外,在DeepSeek Harness公开之前,把已公布的智能体分数当作服务商的说法就好:把生产环境的智能体切过去之前,先在自己的代码仓库上跑一遍基准。

DeepSeek V4 Flash与其他模型对比

DeepSeek V4 Flash对比DeepSeek V4 Pro

同一家族,取舍相反。Pro是1.6万亿参数的旗舰,每个token激活490亿;Flash激活130亿,输出标价只有Pro的三分之一。在DeepSeek公布的智能体基准测试上,0731版本的Flash如今九项全部高于V4 Pro(Preview),所以选Pro的理由是长链条多步推理的深度,而不是智能体吞吐。Okou已不再提供V4 Pro——这里的页面只作参考。

DeepSeek V4 Flash对比GPT 5.6 Luna

两者都是各自家族里的便宜档,也都跑在Codex框架上。Luna是多模态的,背后有OpenAI的生态;Flash只处理文本、开放权重,输出标价不到Luna的四分之一,公布的智能体基准分数也高出一截。需要视觉或OpenAI特有的行为就选Luna,做的是代码和工具的活就选Flash。

DeepSeek V4 Flash对比Claude Sonnet 4.6

Sonnet 4.6是带视觉的核心智能体模型,有Claude Code框架和Anthropic在工具路由上的可靠性;Flash是省钱档的纯文本模型,输出价格大约只有Sonnet的五十分之一。决定一次运行成败的步骤留给Sonnet,下面的量交给Flash。

结论:你该用DeepSeek V4 Flash吗?

在Okou上跑一个称职的编码智能体,DeepSeek V4 Flash是最省钱的方式:接近前沿的智能体基准成绩、100万token的窗口,输出每100万token只要0.28美元。先在自己的代码仓库上验证服务商给的数字,把视觉和最难的推理放到别处,论单次完成任务的成本,它很难被超过。

常见问题

DeepSeek V4 Flash的上下文窗口有多大?

输入100万token,每次回复最多输出384K token。DeepSeek建议在highmax推理强度下使用完整的384K输出上限。

DeepSeek V4 Flash多少钱?

服务商标价为每100万token输入0.14美元、输出0.28美元,缓存命中每100万token收0.0028美元,缓存写入不收费。在Okou上它属于$价格档,四档里最便宜的一档。DeepSeek已宣布一项高峰时段政策,会把自己的标价在北京时间09:00-12:00和14:00-18:00翻倍,但该政策尚未生效。

DeepSeek V4 Flash比DeepSeek V4 Pro更好吗?

在DeepSeek为0731版本公布的九项智能体基准测试上,是的:每一项都高于V4 Pro(Preview),而它每个token只激活130亿参数,Pro是490亿。Pro在长周期多步推理上仍有优势。Okou已不再提供V4 Pro。

DeepSeek V4 Flash支持视觉吗?

不支持。它只接受文本和代码。需要处理截图、图表或PDF的步骤,交给Claude Sonnet 4.6或GPT 5.6 Luna这样的多模态模型。

DeepSeek V4 Flash在Okou上用的是哪个框架?

Codex。Okou通过DeepSeek的Responses API调用它,目前V4 Flash是唯一支持该API的DeepSeek模型。你可以把它当作Built-in模型、按Okou积分计费,也可以自带DeepSeek API密钥。

替代选择

在Okou上使用DeepSeek V4 Flash

在Okou上使用DeepSeek V4 Flash的两种方式

Okou既支持把DeepSeek V4 Flash作为Built-in模型使用、按Okou积分计费,也支持你用DeepSeek API key自带密钥接入。Built-in这条路走的是Okou Managed路由和下文说明的价格档;自带密钥这条路由上游服务商直接向你收费,完全跳过Okou的积分换算。

Okou的建议

Okou把DeepSeek V4 Flash定位为省钱的选择,用于批量分类、前置过滤、对延迟敏感的回复等高频场景。

积分与$价格档

Okou给每个Built-in模型都定了四档积分价格——$$$$$$$$$$——它会作为标记出现在模型选择器里,也出现在zero model lsprice tier那一行。DeepSeek V4 Flash属于$。这一档决定你从Okou积分余额里扣掉多少;上表里的服务商标价,则是上游服务商在Okou把它换算成积分之前收取的费用。

自July 31, 2026起在Okou上可用。