公司动态

我把Kimi K3和GPT-5.6 Sol拉来打了一架,结果有点意外

📅 2026/7/24 16:23:51
我把Kimi K3和GPT-5.6 Sol拉来打了一架,结果有点意外
先说结论Kimi K3 距离顶级闭源模型已经到了九成以上的水平。但「九成」和「十成」之间差的不是参数是细节。上周月之暗面扔出一颗重磅炸弹——Kimi K32.8万亿参数的开源模型发布就登顶 Frontend Code Arena 榜单第一。作为一直盯着开源模型的技术号我第一时间做了件事把它和目前最强的闭源模型之一 GPT-5.6 Sol 拉来做了一次硬碰硬的对比。今天就跟你聊聊这场「开源 vs 闭源」的较量到底谁赢谁输以及——对你我这样的开发者来说意味着什么。一、为什么用「童年游戏」来测你可能想问测模型代码能力让它写个单文件前端页面不就行了不行。单文件页面太简单看不出复杂工程里的真实水平。模型只要会调几个API、写个动画就能糊弄过去。3D游戏才是真正的试金石。它涉及渲染、碰撞、状态管理、实时交互——模型不只要写代码还要根据页面视觉反馈反复调试。普通前端写错了最多布局乱游戏写错了直接跑不起来。于是我想了个损招让 K3 和 GPT-5.6 Sol 用完全相同的提示词各自复刻 5 款童年经典游戏比谁更能跑出「可玩的成品」。为什么只选 GPT-5.6 Sol不测 Claude实话实说一是太贵二是我们的号被封了没法稳定复测。这大概就是开源模型最大的优势——随便你测不用看人脸色。二、5 款游戏逐个拆解1. 植物大战僵尸Kimi K3GPT-5.6 Sol核心玩法绿色草坪、僵尸推进、土豆雷爆炸同左 选关界面额外功能无星星评价、胜负统计代码结构单文件内联全部系统多模块拆分 存档校验K3 版打开就能玩但玩几局后会发现——没有选关、没有暂停、没有星星评价也没有胜场统计。缺目标感。GPT 版流程更长有明确的关卡和评价体系。2. 合金弹头Kimi K3GPT-5.6 Sol角色渲染自定义风格更丰富敌人种类少2种完整死亡机制直接结束检查点续关碰撞判定圆形矩形碰撞箱K3 版画面有自己的风格但容错率低死亡成本高。GPT 版容错更高更像街机原版体验。3. 拳皇97K3 版有角色选择和难度选择必杀技反馈密集人物渲染细节比 GPT 的方块人更好。但缺舞台选择、血量/时间/伤害倍率等规则调整设置项也没持久化。GPT 版把这些选项做全了规则可以保存更像能反复调整着玩的格斗游戏。4. 魂斗罗K3 版打开就能玩射击移动正常。但缺标题画面、选关、暂停悬浮陆地只有视觉效果人物站不上去。GPT 版完整街机流程平台碰撞生效。5. 坦克大战K3 版基地保护、升级、地雷等核心机制都在。但缺菜单、暂停、关卡返回和关卡管理。GPT 版完整菜单系统、暂停菜单、结算界面和关卡配置校验。三、从 5 个游戏看 K3 的「能」与「不能」我总结成五个判断维度能不能直接玩、画面完成度、操作手感、规则完整性、聪明程度。K3 的优势5个游戏都能直接打开玩核心机制成立植物大战僵尸和拳皇97视觉氛围强高光反馈密集能在提示词之外主动加内容星星升级、武器切换等某些单点如角色渲染甚至优于GPT-5.6 SolK3 的短板规则完整性普遍不足。大多数游戏缺菜单、暂停、选关、存档校验等外围流程部分游戏死亡惩罚过重、容错率低单款游戏UI精致度参差不齐一句话总结GPT-5.6 Sol 把预算花在了「玩家不会夸但缺了会出戏」的地方——菜单层级、规则持久化、边界校验、屏幕特效。这叫「工程完整度」。四、效率差距GPT 快但贵这点必须说清楚。GPT-5.6 Sol 在 Codex 上合理利用子 Agent 并发完成时间约为 K3 的25%token 消耗也更省。看起来 GPT 完胜但是——GPT-5.6 Sol 的 API 定价更高加上跨境访问和支付门槛国内个人开发者的实际使用成本反而更高。K3 虽然单次任务消耗更多 token但国内可直接访问进入门槛更低。对于国内开发者来说能用、便宜、稳定的才是今天该用的。五、游戏之外K3 能不能做真实全栈游戏对比有个局限主要看前端表现力。我还想知道当任务从「写一个可玩的页面」切换到「非游戏类的真实全栈工程」——需要数据库设计、REST 接口、前端联调一起跑通时K3 能不能独立完成于是我单独给 K3 布置了一个全栈项目基于开源项目paper-graph-manager论文引用关系图谱管理系统让它自己从零跑通后端、补齐接口、验证前端渲染。整个过程没有手动介入调试全部由 K3 自己完成。1. 环境启动与依赖修复K3 第一步就遇到三个ModuleNotFoundErrordotenv、pyvis、kimi_agent_sdk。它正确判断这些是环境问题不是代码 bug逐个安装后服务成功跑在http://localhost:8001健康检查返回 ok。2. 后端功能实现K3 改动了三个文件database.py新增paper_references表复合主键、外键、索引graph.py新增build_reference_graph()和export_reference_html()main.py新增 4 个引用端点 2 个图谱端点为验证质量K3 在全新端口 8002 上跑了 8 步端到端测试全部通过。新增测试 36 个全部通过全量134 passed、2 failed。K3 用git stash撤回自己的改动后这 2 个失败依然存在——证明是项目预存的 legacy 问题与本次功能无关。3. 前端联调启动 Vite 时遇到路径别名报错Failed to resolve import /lib/utils。这是典型工程化问题。K3 没有卡住而是通过Kimi Code 的 WebBridge 直接控制浏览器验证页面状态注入 JS 探测rootLen确认页面从 0 增长到30081说明前端确实渲染出来了。六、写在最后Kimi K3 在呈现效果、游戏逻辑和操作流畅度上表现出色。作为开源模型能达到这个完成度已是少数能打的存在是中国开源模型参数的里程碑。但把标准拉到「能直接发给玩家反复打开」K3 在系统完整度、规则严谨性和包装层上还有明显差距。它更适合快速产出可玩原型而不是一步到位的完整产品。横向对比之外全栈项目补上了另一层判断K3 能读懂已有项目结构区分环境问题和代码问题独立完成数据库设计、REST 接口和前端联调并通过浏览器自动化验证真实渲染。这说明它的能力边界不只有前端页面真实后端工程也能端到端跑通。我的推荐场景用哪个快速原型、可玩demoKimi K3国内直连零门槛完整产品、工程规范严格GPT-5.6 Sol但成本高学习研究、改开源项目Kimi K3开源可改从游戏 case 完成度看K3 已接近顶级闭源模型 90% 以上的水平。你抢到 Kimi 会员了吗关注「小二丶说技术」用开发者的眼睛看AI转载请注明出处