摘要:

性价比之王要打 Agent 仗了

凤凰网科技 出品

作者|Dale

编辑|董雨晴

7 月 31 日午后,凤凰网科技查询 DeepSeek 官网发现,DeepSeek-V4-Flash 正式版 API 上线公测。与以往 “Pro 强、Flash 弱”的分层逻辑不同,这次更新释放了一个值得关注的信号 ——Flash 正式版在多项 Agent 基准测试中的表现,已经逼近甚至超越了三个月前 V4-Pro 预览版的水平。

图片

官方更新日志显示,V4-Flash 正式版在 Terminal Bench 2.1 上拿到 82.7 分,NL2Repo 54.2 分,Cybergym 76.7 分,Toolathlon verified 70.3 分。而 V4-Pro 预览版在 Terminal Bench 2.0 上的得分为 67.9 分。

需要说明的是,Terminal Bench 2.0 与 2.1 并非同一版本的测试集,直接对比并不完全公平。但一个激活参数仅 130 亿的轻量版,在 Agent 能力上跑出这样的分数,已经在说明后训练阶段的优化空间,可能比单纯堆参数更具杠杆效应。

此外,DeepSeek也特别说明目前公测仅限API,App和网页端暂无法体验最新能力。DeepSeek-V4-Pro正式版将尽快发布。

“仅重新进行了后训练”

DeepSeek 官方在更新日志中表示,“DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-preview 保持一致,仅重新进行了后训练。”

根据 DeepSeek 官方技术报告,V4-Flash 总参数 2840 亿,激活参数 130 亿;V4-Pro 总参数 1.6 万亿,激活参数 490 亿。两者在模型规模上相差一个数量级。如果 Flash 能通过后训练把 Agent 能力拉到接近 Pro 的水平,那意味着对于特定任务而言,模型规模并非决定性因素 —— 训练方法和数据质量的权重,正在上升。

官方还特别注明,本次公开基准测试中的 Code Agent 任务,使用了 DeepSeek Harness 极简模式作为框架进行测试,max 档位,topp=0.95,temperature=1.0。这个细节暗示,DeepSeek 可能在 Agent 框架层面也做了针对性优化,而非仅仅是模型本身的提升。

这也是DeepSeek官方自研Harness首次以正式命名出现,此前,梁文锋曾把AGI的实现路径比作爬楼梯:语言模型是第一级,去年解决的是CoT(思维链),今年的台阶是Agent,而Agent之后必须解决的问题,是持续学习——让模型像人一样长期积累经验,而不是每次都被喂入完整的上下文才能工作。再往后,才是自我迭代的“奇点”与具身智能 。“

AI现在不缺品位和直觉,它缺的是持续学习的能力”他说,“投资人看Agent,我们看怎么解决学习。”

持续学习听起来是模型层面的命题,但它的工程落点,恰恰在Harness上。DeepSeek的Agent Harness团队组建于今年3月,挂帅者崔添翼是90后,浙大计算机出身,手握6枚ACM亚洲区域赛金牌,曾在顶级量化机构Jane Street任职九年,今年3月加入DeepSeek,此后其在5月大力招兵买马。

据透露,DeepSeek的Harness规划在V4正式版上线之际同步推出。另据DeepSeek在日志末尾表示,“DeepSeek-V4-Pro 正式版将会尽快发布。”

生态层面的一次正面交锋

如果说 2023 年的大模型竞争是 “拼通用能力”,2024 年是 “拼长上下文”,那么 2026 年的关键词,毫无疑问是 Agent。

Agent 能力 —— 即模型自主规划、调用工具、执行复杂任务的能力 —— 正在成为衡量大模型实力的新标尺。从 Terminal Bench(终端操作)、NL2Repo(代码仓库生成)到 Cybergym(网络安全任务)、SWE-bench(软件工程),一系列 Agent 基准测试正在重新定义什么是好模型。

从全球范围看,Agent 能力的第一梯队目前仍由闭源巨头把持。据 benchlm.ai 等第三方评测平台数据,GPT-5.6 Sol、Claude Opus 系列在多数 Agent 基准测试中位居前列。国产阵营中,GLM、Qwen 等也在快速追赶。

DeepSeek 此次将 Flash 的 Agent 能力大幅拉升,战略意图很清晰:用高性价比的轻量模型,切入 Agent 应用的庞大市场。

毕竟,Agent 场景对推理速度和成本的敏感度,远高于纯对话场景。一个需要反复调用工具、多轮推理的 Agent 任务,如果用旗舰模型跑,成本可能是 Flash 的数倍甚至数十倍。如果 Flash 能在 Agent 能力上达到 “够用甚至好用”的水平,其性价比优势将极具杀伤力。

官方公布的两个内部测试集也目标明确。DSBench-FullStack(内部全栈开发测试集)得分 68.7,DSBench-Hard(内部 Coding Agent 难题测试集)得分 59.6。这从侧面印证了 DeepSeek 的定位 —— 把 Flash 打造成开发者和 Agent 应用的首选底座。

一场生态暗战也在悄然打响,正式版 V4-Flash 原生支持 Responses API 格式,并针对性适配了 Codex。

Responses API 是 OpenAI 力推的新一代 API 格式,相比传统的 Chat Completions,它更适合 Agent 场景 —— 支持更灵活的工具调用、更复杂的多轮交互、以及更精细的输出控制。

DeepSeek 原生支持这一格式,意味着开发者可以更低成本地将基于 OpenAI 生态开发的 Agent 应用迁移到 DeepSeek 上。这将是二者在生态层面的一次正面交锋。

对 Codex 的适配,则瞄准了代码生成与软件开发这一垂直场景。Codex 是 OpenAI 面向代码领域的模型,DeepSeek 针对性适配,等于直接在 OpenAI 的传统优势领域发起挑战。

这些动作放在一起看,DeepSeek 的野心不止于做一个“便宜的替代品”,而是要在 Agent 时代建立自己的生态位。

500 亿融资之后:高估值下的时间窗口

此次更新,距离 DeepSeek 完成首轮外部融资不到两个月。

约一个多月前,DeepSeek完成成立近三年来的首轮外部融资,总额超 500 亿元人民币,创下中国 AI 行业单轮融资纪录,投后估值约 520 亿美元(约合人民币 3500 亿元)。投资方阵容包括腾讯、宁德时代、京东等产业巨头,以及多家国资产业基金。

图片

7 月中旬,DeepSeek 有意推进新一轮私募融资,投前估值约 710 亿美元(折合人民币约 4800 亿元),较首轮融资后的 520 亿美元估值上涨约 37%。从 520 亿到 710 亿,间隔不足六周。

高估值背后,是市场对 DeepSeek 技术实力的认可,也是对其商业化前景的押注。但高估值同样意味着高预期、高压力。

据多家媒体报道,DeepSeek 创始人梁文锋本人在首轮融资中出资约 200 亿元人民币,通过特殊架构牢牢掌控公司控制权。这位脱胎于幻方量化的创始人,此前近三年一直坚持自有资金投入,如今从 “不融资不上市” 转向积极拥抱资本,本身就是一个强烈的信号 ——DeepSeek 正在加速冲向商业化和 IPO。

Flash 正式版的上线,或许可以看作 DeepSeek 在资本加持下的一次 技术兑现。但真正的考验还在后面:Pro 正式版能否如期而至?Agent 能力的提升能否转化为实打实的收入?在 OpenAI、Anthropic 等巨头的夹击下,DeepSeek 的高性价比路线将如何发挥优势。

Agent 战争的大幕才刚刚拉开。DeepSeek 用一个轻量模型的大幅进化,给行业出了一道新题 —— 当后训练的红利被充分挖掘,当效率的提升开始抵消参数的差距,大模型的竞争逻辑,可能要被重新书写了。

本文转自:凤凰网科技

原文地址: https://tech.ifeng.com/c/8vBTUYCvpBA