DeepSeek V4 Pro 凌晨突袭:Agent 跑分一夜追平 Claude Fable 5,旗舰智能体的入场费被打
BiRun 消息,作者:克洛德,深潮 TechFlow 深潮导读: 8 月 13 日凌晨,DeepSeek 毫无预兆地上线 V4 Pro 正式版:同一个 API 名字,Agent 能力却从预览版的「基本不能打」跳到直逼 Anthropic 旗舰 Claude Fable 5,部分榜单实现反超。更狠的是价格,只有海外同级模型的一个零头。对开发者和 AI 创业者来说,旗舰智能体的入场费被再次打穿。唯一的问题是,官方的涨价预告已经挂出来了。 今天凌晨,DeepSeek 官网悄然更新,DeepSeek-V4-Pro 模型版本升级为 0813 正式版,开发者无需改动代码,调用 deepseek-v4-pro 即是最新模型。 新模型支持 100 万 token 上下文和最高 38.4 万 token 输出,思考模式默认开启,并兼容 OpenAI、Anthropic 及 Responses API 格式,Codex、Claude Code、OpenCode 等主流 Agent 工具可直接接入。消息同时登上 Hacker News 首页(700 余赞)和知乎热榜(超 2000 万热度),成为今天中英文 AI 圈的最大共识热点。 凌晨突袭:同一个 API 名字,昨天不会干的活今天能干了这次更新的核心是 Agent 能力。 按官方公布的评测,V4 Pro 正式版在自家软件工程基准 DeepSWE 上的得分从预览版的 12.8 暴涨至 62.7;自然语言生成代码仓库的 NL2Repo 从 38.5 提至 61.5;全栈开发困难子集 DSBench-Hard 翻倍至 67.2。 用国内一家科技媒体实测后的说法:「同一个 API 名称,昨天基本还不会做的活儿,今天就可以跟全球第一梯队的代码 Agent 掰手腕了。」在爱范儿的实测中,面对「搜集近日科技新闻做一个仿传统媒体首页」这类模糊指令,V4 Pro 能自主拆解需求、分步执行,完成度相当高。Hacker News 上也有开发者晒出实战账单:拿它跑了一整天的交通模拟和分布式物理引擎优化,20 亿 token 花了约 12.5 美元,「找到了显著的性能提升,且没有引入任何新问题」。 安全攻防反超 Fable 5,但开源头把交椅还不是它官方口径下,V4 Pro 在 AI 安全攻防基准 Cybergym 上拿到 83.3 分,反超 Claude Fable 5 的 83.1;工作流智能体 AutomationBench 同样实现超越;高难推理 HLE(启用工具)拿到 60.0,仅次于 Fable 5 的 63.0;终端操作 Terminal Bench 2.1 拿到 87.9,高于 Claude Opus 4.8 的 85.0。 但两点需要泼冷水。一是它与月之暗面的 Kimi K3 仍有微弱差距(Terminal Bench 2.1 上 87.9 对 88.3),开源界的头把交椅还没换人。二是第三方口径没有官方那么乐观:OpenRouter 援引 Artificial Analysis 的综合智能指数给它打了 45.3 分,「优于 70% 的模型」,与「追平 Fable 5」的官方叙事存在温差。官方跑分是自家 Harness 框架下测出来的,独立验证还需要时间。 3 元对 10 美元,旗舰 Agent 的「零头定价」 真正让对手难受的是价格。 V4 Pro 正式版维持预览版定价:每百万 token 缓存命中输入 0.025 元、未命中输入 3 元、输出 6 元。 作为对比,Kimi K3 的 API 价格是输入 3 美元、输出 15 美元。
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯