公司动态

Codex到底该选哪个模型?

📅 2026/8/15 10:49:56
Codex到底该选哪个模型?
我是 Plus 用户平时在 Codex 里用得最多的是Sol medium。理由很简单它能力强我不太需要担心选错。可额度不够用以后这套办法就有点撑不住了。明明只是改几个文件我也开 Sol需求已经写得很清楚还是开 Sol。很多时候并非任务离不开它只是我懒得在开始前多想一步。看完评论区我发现大家的用法大致分成三种无脑 Sol让 Sol 出方案、Luna 执行日常开发用 Terra把 Sol 留给真正难的部分。我现在更倾向于第三种。但这里有个问题必须先说清楚什么才算“真正难”01 一个简单问题也可能变成复杂任务如果目标明确、操作过程明确任务一般不会太难。比如把一个字段改名用户已经告诉我改哪里、改成什么也有测试可以检查。但“目标不清楚”本身不等于复杂。有时只是少问了一句话。“帮我把页面改好看一点”很模糊补充参考图、目标用户和验收标准以后可能马上就能做。我更在意的是执行过程中会冒出多少意外。拿批量处理文件来说规则不难数量一多事情就会变味。1000 份文件哪怕只有 1% 不符合模板也有大约 10 个例外。接下来还会碰到重复数据、处理中断、失败重试以及怎么确认没有漏掉。单个动作很简单整批交付却不轻松。所以我判断任务时会看四件事目标清不清楚、过程里要做多少判断、规模会不会放大异常、做错以后返工有多贵。02 我现在怎么选放到我自己的任务里大概是下面这样当前任务我会先用什么时候升级需求没想清、约束互相冲突、要做方案取舍Sol medium多步依赖很深或返工昂贵时升 high需求基本明确日常写代码、改代码Terra连续失败或出现跨模块判断时换 Sol规则固定、数量大、可以自动验收Luna出现模板外异常时交回 Terra 或 Sol只想尽快做出可运行原型Luna 或 Terra准备上线、补测试和处理边界时再升级推理档位我也不再默认拉满。Medium 先跑确实遇到多步推理、冲突约束或高风险交付再升 high。xhigh 和 max 留给那些“多花额度确实能少返工”的任务。如果模型选择器里还有GPT-5.5、GPT-5.4可以继续留给已经验证稳定的旧项目GPT-5.4 mini 更适合成本敏感、结果容易检查的小任务。OpenAI 当前模型目录里出现的模型不一定会同时开放给每个 Plus 用户还是要以自己在 Codex 里实际看到的选项为准。03 那张成本图其实是在提醒我们别把档位拉满这张 Artificial Analysis 的图横轴是完成一项 Intelligence Index 基准任务的平均 API 成本纵轴是综合智能指数。OpenAI 的 GPT-5.6 模型指南把 Sol 定位为最高能力Terra 平衡能力与成本Luna 面向高效率和大批量工作。图里的分布也差不多Luna 集中在左边Sol 一路往右上走Terra 夹在中间。综合基准测不到我在 Codex 里真正关心的全部东西比如响应速度、工具调用、长任务稳定性以及失败后要不要我手动收拾。图里的 API 成本也不等于 Plus 额度。我从图里拿走的结论只有一个同一个模型从 high 升到 xhigh、max能力还会涨但 token 用得更多。真正的成本还包括等待、重试、人工修改和返工。便宜模型连续做错三次未必便宜一个只需要做到“能用”的任务也没必要开 Sol max 去追最后那几分。04 一次整本翻译让我开始盯着交付看我测试过把整本《爱丽丝梦游仙境》翻译成中文再生成 PDF。这个需求看上去很清楚提取正文、逐章翻译、重新排版、导出文件。Luna medium 跑了 5 分多钟最后真的生成了一份 185 页 PDF。问题是只有封面和目录变成了中文正文还是英文。看到文件出现的那一刻我还以为任务结束了。打开以后才发现它只是“产出了东西”。这种任务难的地方不在某一句英文会不会翻而在几十个章节能不能全部走完过程中有没有跳过内容导出的 PDF 能不能验收。后来我给这类任务加了分章处理和程序检查专门查章节数、残留英文与空白页。05 两个编程任务让我换了两次标准另一次测试是做猫咪偷鱼小游戏。Luna 很快给出一个能玩的版本猫咪可以移动、偷鱼、躲开障碍再跑回猫窝。画面谈不上精致但我马上就能试玩也知道下一轮该改什么。还有一个 3D 魔方Luna 用了 19 分 12 秒两个核心测试通过页面可以直接运行。如果我当时只是验证玩法和交互这两个结果都够用。原型阶段最怕的不是少两个测试而是每次改动都要等很久等到最后连自己刚才想验证什么都忘了。准备上线时猫咪小游戏要补关卡状态、边界条件和自动化测试3D 魔方也要确认打乱与还原逻辑甚至做随机压力测试。06 模型路由 Skill好像真可以做写到这里我前面那个跑题的想法反而越来越像回事做一个模型路由 Skill。它读取前面那几个判断条件只给三样东西推荐模型、推理档位、升级条件。模型发布新版本时替换路由表就行不用推翻整个工作方法。我接下来大概会真的做一个先拿自己的任务试。