
7月31日午后,DeepSeek悄悄上线了V4-Flash正式版API。
没有发布会,没有预热。但在开发者圈子里,这条消息的分量不轻——一个激活参数只有130亿的轻量模型,Agent能力跑出了超越自家旗舰V4-Pro预览版的成绩。

翻译一下:小的比大的更能干活了。
数据说话
先上硬数据

V4-Flash正式版的Agent基准测试成绩:Terminal Bench 2.1拿到82.7分,NL2Repo 54.2,Cybergym 76.7,DeepSWE 54.4,Toolathlon Verified 70.3。
作为对比,V4-Pro预览版在Terminal Bench 2.0上是67.9分。虽然测试集版本不同、不能直接对比,但趋势很明显——一个130亿激活参数的轻量版,在Agent任务上碾压了490亿激活参数的旗舰版。
两者差了接近四倍。
更值得注意的是,官方明确说:模型结构、尺寸和预览版完全一致,仅重新进行了后训练。
没有换架构,没有加参数,没有堆算力。只是换了训练方法,同一个模型就脱胎换骨了。
这件事的意义在于:后训练的优化空间,可能比单纯堆参数更具杠杆效应。
为什么是Agent?
2026年大模型竞争的关键词,毫无疑问是Agent。
不是对话、不是写作、不是画图——是模型自主规划、调用工具、执行复杂任务的能力。
Agent场景有个特点:对推理速度和成本极其敏感。一个需要反复调用工具、多轮推理的任务,用旗舰模型跑一次的成本可能是Flash的十倍甚至几十倍。
Flash的定位很清晰:用十分之一的参数规模,拿到"够用甚至好用"的Agent能力,然后把价格打到地板。
这才是性价比之王的打法。不是每个场景都需要1.6万亿参数的怪兽,大部分Agent应用要的是"又快又便宜还能干活"。
两个更值得注意的信号
除了模型本身,这次更新还有两个信号。
第一,原生支持Responses API格式
这是OpenAI力推的新一代API格式,比传统的Chat Completions更适合Agent场景——更灵活的工具调用、更复杂的多轮交互、更精细的输出控制。DeepSeek原生支持这个格式,意味着开发者可以把基于OpenAI生态开发的Agent应用,几乎零成本地迁移过来。
这是生态层面的正面抢人。
第二,针对性适配了Codex
Codex是OpenAI在代码领域的招牌模型。DeepSeek专门适配它,等于直接在OpenAI的传统优势地带发起挑战。再加上自研的Agent Harness框架首次以正式命名出现,DeepSeek在Agent工具链上的布局已经浮出水面。
梁文锋此前把AGI的实现路径比作爬楼梯:语言模型是第一级,CoT是第二级,Agent是今年的台阶,再往后是持续学习,最后才是自我迭代的"奇点"。
V4-Flash正式版,就是他在Agent这级台阶上的落子。
500亿之后的技术兑现
时间线拉一下。
一个多月前,DeepSeek完成了首轮融资,超500亿人民币,投后估值520亿美元。投资方包括腾讯、宁德时代、京东和多家国资基金。梁文锋本人出资约200亿。
7月中旬,新一轮融资启动,投前估值已跳到710亿美元。从520亿到710亿,间隔不到六周。
高估值意味着高预期。市场押注的不只是模型能力,而是商业化前景。
Flash正式版的上线,可以看作一次技术兑现——我融了这么多钱,现在告诉你这些东西能用。
但真正的考验在后面:V4-Pro正式版何时发布?Agent能力的提升能否转化为实际收入?在OpenAI和Anthropic的夹击下,高性价比路线能跑多远?
结语
这次更新的本质,不是"DeepSeek又发了个新模型",而是大模型竞争逻辑可能正在被改写。
过去两年的默认共识是:参数越多、模型越大、能力越强。但V4-Flash正式版用事实证明——在特定任务上,训练方法和数据质量的权重,正在超过参数规模。
130亿激活参数打赢490亿。不是靠堆,是靠练。
这对整个行业是一个信号:Agent时代的竞争力,不一定属于模型最大的那个,而是属于训练最聪明、生态最开放、性价比最高的那个。
Agent战争的大幕刚拉开。DeepSeek选了一个聪明的站位——不当最贵的,当最划算的。
而"最划算"这三个字,在商业化时代,往往是最致命的武器。
本文作者可以追加内容哦 !