公司动态

DeepSeek V4 Pro正式版悄悄上线Grok 4.6 同日发布

📅 2026/8/14 7:03:44
DeepSeek V4 Pro正式版悄悄上线Grok 4.6 同日发布
8月12号到13号大模型圈发生了一件很有意思的事——两个重量级更新撞在了一起。一边是 DeepSeek V4 Pro 悄悄转正模型版本号从预览版跳到了 0813 正式版没有发布会、没有博客长文只在 API 文档的表格里改了一行字。另一边是 xAI现在叫 SpaceXAI发布 Grok 4.6主打长时程 Agent 能力Artificial Analysis 智力量表直接干到 61 分追平 GPT-5.6 Sol。两件事放在一起看比单独看任何一个都更有信息量。Agent 赛道的天花板被从两个方向同时捅破了。DeepSeek V4 Pro从能用到平替只用了四个月先看 DeepSeek 这边。V4 Pro 四月份刚出来的时候还是预览版Agent 能力只能说有那个意思但离真正干活还有距离。这次 0813 正式版变化是质变性的。直接看几个核心数字Terminal Bench 2.1从 72.1 → 87.9反超 Claude Opus 4.8 的 85.0离 Fable 5 的 88.0 只差 0.1。CyberGym从 52.7 → 83.3反超 Opus 4.8 的 78.3也略高于 Fable 5 的 83.1。DeepSWE从 12.8 → 62.7——这个最夸张直接翻了近五倍超过 Opus 4.8 的 58.0。AutomationBench从 12.8 → 31.8反超 Opus 4.8 的 27.2 和 Fable 5 的 29.1。数据来源是 DeepSeek 官方 API 文档页和 HN 上的开发者整理 Hacker News。官方文档目前暂时不可访问但多个独立来源交叉验证了这些数字 Decrypt via AI Coin。如果这些数字经得住第三方实测的话意味着一件事开源模型或者说准开源的 API 模型第一次在 Agent 核心基准上跟闭源顶级模型站在了同一个量级。不是追近是在多个单项上已经反超。真正可怕的不是分数是价格DeepSeek V4 Pro 的定价是输入 3 元 / 百万 Token输出 6 元 / 百万 Token缓存命中输入只要 0.025 元 钱江晚报。折成美元大概是 $0.435 / $0.87 per million tokens。对标一下Claude Fable 5 是 $10 / $50。输入差 23 倍输出差 57 倍。这还不是最狠的。如果算上 Agent 编程场景里典型的缓存命中比例——有开发者按照 Opencode 公开的数据算了一笔账典型的 Agent 编程请求750 输入 290 输出 82k 缓存命中V4 Pro 单次请求成本约 $0.000875等价 Opus 成本约 $0.052——实际成本差是大约 60 倍Hacker News。六十倍是什么概念就是以前你花 5000 块钱一个月的 API 预算才能干的活现在 80 多块就搞定了。预算不变的话你可以把 Agent 的尝试次数翻几十倍或者把以前不敢碰的长时程任务直接拉满。当能力差缩小到 5%价格差拉大到 45 倍选择就不再是技术问题了是商业问题。而且别忘了官方还挂了一条预警计划近期整体上调 API 定价预计涨幅较大。现在这个价格可能是地板价。Grok 4.6xAI 也下场了赛道从单挑变混战同一天xAI 的 Grok 4.6 也来了。Artificial Analysis Intelligence Index 拿到 61 分跟 GPT-5.6 Sol 打平仅次于 Claude Opus 563和 Fable 562Artificial Analysis。几个关键看点Agent 能力是核心升级。Grok 4.6 主打长时程 Agent 任务——多步骤研究、跨代码库工作、从产品想法直接生成可用应用。官方说在更长的任务轨迹上模型会更频繁地自我测试和验证而不是找到一个差不多的答案就停下来 unite.ai。GDPval-AA v2 Elo 1753。这个基准测的是真实经济价值类工作不是学术题。Grok 4.6 排第三前面只有两个 Claude Opus 5 变体。比上一代 Grok 4.5 高了大约 200 Elo CoinDesk。价格$2/$6 per million tokens。比 DeepSeek 贵但比 GPT-5.6 Sol$5/$30和 Claude Opus 5$5/$25便宜 60% 以上。有意思的是Grok 4.6 的核心卖点也不是通用推理不是 benchmark 刷分是Agent、编程、长时程任务。跟 DeepSeek V4 Pro 的主打方向高度重合。三个信号说清楚 Agent 赛道变天了把这两个发布放在一起看至少有三个信号值得注意第一Agent 能力正在成为新的主战场。前两年的模型发布比的是 MMLU、比的是通用推理、比的是数学题。今年以来越来越多的旗舰模型把发布重点放在了 Agent 基准上——Terminal Bench、SWE-bench、CyberGym、AutomationBench。为什么因为通用推理的边际收益在递减而 Agent 能力直接决定了模型能不能真正干活、能不能替代真实工作流。能考高分的模型不稀奇能自己写代码、自己跑终端、自己查 bug 的模型才是真的能创造经济价值。第二闭源独一档的格局正在被打破。就在半年前大家还默认一个事实闭源顶流GPT、Claude是第一梯队开源模型国内的、Meta 的差一大截没得比。现在呢DeepSeek 在 Agent 单项上追平甚至反超 Fable 5Grok 4.6 跟 GPT-5.6 Sol 打平。第一梯队还是第一梯队但后面的人已经快贴脸了。而且后面的人价格是你的十分之一甚至几十分之一。这不是技术代差这是商业代差。技术差 5%价格差 45 倍——对于 90% 的场景来说怎么选根本不需要想。第三双 API 兼容是杀招。DeepSeek V4 Pro 同时兼容 OpenAI 格式和 Anthropic 格式的 API。这件事看起来小实际上非常狠。它意味着什么意味着你现在用 Claude 的应用改一行 base URL 就能切到 DeepSeek。迁移成本几乎为零。以前切换模型的成本是什么要改 prompt 格式、要调参数、要适配工具调用格式、要重写接入层。现在这些都不用了直接换。当模型能力足够接近、API 格式完全兼容、价格差几十倍的时候用户的迁移阻力比想象中小得多。写在最后Agent 时代的平替已经来了DeepSeek V4 Pro 和 Grok 4.6 撞档发布不是巧合。它们代表的是同一件事大模型的竞争焦点正在从谁更聪明转向谁更能干活而干活的性价比正在被第二梯队以极快的速度追平。对于开发者和创业者来说这是个好消息。以前你想做一个 Agent 产品算力成本是悬在头顶的达摩克利斯之剑——用户越多亏越多。现在有了 DeepSeek 这种级别的平替很多以前不敢想的商业模式突然就变得可行了。对于闭源巨头来说这是个警钟。靠我比你聪明 5%撑着 45 倍的溢价能撑多久当第二梯队的模型在 Agent 核心场景已经够用了溢价的护城河还剩多少AI 行业最有意思的阶段永远不是第一名遥遥领先的时候而是第二名快追上的时候。现在第二名们追上来了。