公司动态
GPT-5.6 更聪明之外:模型竞争开始算成本账
GPT-5.6 把模型升级拉回成本、稳定性和拒答边界。从每 token 更多智能到模糊输入拒答开发者该重新评估模型真实稳定性。大模型发布会越来越像一场账本公开。过去大家盯着模型参数、上下文长度和榜单名次。现在真正敏感的问题变成了同样一美元、同样一秒延迟、同样一段上下文到底能换来多少可靠工作量。GPT-5.6 的描述里有一个关键词很值得看每 token 更多智能。这句话听起来像宣传语但背后是一个很现实的工程问题。模型不可能无限变贵企业也不可能把所有任务都交给最高规格模型。真正能大规模落地的模型必须在日常任务上更省在困难任务上能临时升档。图模型竞争正在从能力榜单转向单位成本下的有效工作量。模型选择正在变成资源调度这会让模型调用策略变得更像资源调度而不是简单的“选最强模型”。过去的模型选择现在更重要的问题哪个模型榜单最高哪个模型单位成本产出更稳定谁的推理更强什么时候需要强推理谁上下文更长长上下文里能不能少犯错谁更会回答遇到错误前提时能不能拒绝对开发者来说这意味着模型评估不能只看“最高能力”。还要看日常任务里是否足够便宜高难任务里是否能按需升档长上下文里是否稳定输入有问题时是否敢说“不知道”。单位成本性能会成为企业选型里的硬指标。真正的边界条件在脏输入里GPT-5.6 另一个值得盯的点是它在真实边界条件下的表现。Riley Goodside 最近做了一个很直观的测试给模型看一段看似“手写”的内容但那其实是闭着眼随手画出的无意义涂鸦。测试里GPT-5.6 Sol 更容易生成一个看似合理的答案而 Claude Fable 5 会承认读不出来甚至指出那不是文字。图真实产品里的模型不只要会回答还要知道什么时候不该回答。这类测试不只是好玩。在真实产品里用户不会总是提供干净输入。截图可能模糊文档可能缺页表格可能错列提示词还经常夹带错误假设。一个模型如果总想“给出答案”就会在这些场景里制造额外成本。工程团队最后要花时间做校验、兜底和人工复核。稳定性比上限更接近真实价值所以 GPT-5.6 这一轮真正值得关注的不是它能不能在某些任务上多拿几分而是它能不能在成本、能力和拒答之间找到更好的平衡。模型越来越像生产系统里的一个可调部件。强不强当然重要但更重要的是什么时候该强什么时候该省什么时候该说“不知道”。对 AI 工程团队来说新模型的价值不只看能力上限还要看它在模糊输入、错误前提和真实任务里的稳定性。