模型对比官方资料对照 · 非实测排名
写代码选谁?GPT、Grok、Gemini、DeepSeek 与 Kimi 的工程选型
从接口和工作流看编程模型:代码生成、工具执行、多文件修复与截图反馈分别需要什么。说明 Kimi K2.7 Code 与 K3 的定位差异,并提供可复用的仓库测试清单。

本文基于官方资料整理,核对日期为 2026-09-03;并非原文全文翻译,也不是同条件模型实测。正文区分文档事实与编辑建议,来源可通过编号查阅。
SOURCE NOTES
对比要点
关键差异对照
窄屏可左右滑动查看完整表格。
模享解读 · 非原文观点
给所有候选模型同一份失败测试
与其让各模型自由生成一个不同的小项目,不如选择同一个有失败测试的仓库任务:给出相同版本、相同工具和同样的预算。记录是否修好问题、有没有破坏其他功能,以及人工需要修改多少内容。
前端任务再增加一条视觉验收线:在相同视口检查布局、可访问性与交互。API 的原生看图能力只是输入条件,是否真正保留设计约束仍须观察结果。不要让截图数量或宣传中的榜单分数替代本项目测试。
可以从这份清单开始
- 固定仓库版本、测试集和工具环境。
- 限制无关改动,统计返工量。
- 同时测试成功执行、工具失败和重试。
- 记录模型及框架版本,区分吞吐与整项任务耗时。
来源与说明
以下为本次实际查阅的官方资料。核对日期不是每份文档的发布日期;规格及价格是当日快照。文中的用途建议、算例与实践清单为模享整理,不代表来源机构立场。
- GPT-5.6 Sol · 模型规格与价格(官方来源,新窗口)
OpenAI · 核对于 2026-09-03
- Grok 4.6 · 模型规格(官方来源,新窗口)
xAI · 核对于 2026-09-03
- Gemini 3.8 Flash · 模型规格(官方来源,新窗口)
Google · 核对于 2026-09-03
- Thinking Mode · 开关、档位映射与工具调用(官方来源,新窗口)
DeepSeek · 核对于 2026-09-03
- Kimi K3 · 官方接入与能力说明(官方来源,新窗口)
Moonshot AI · 核对于 2026-09-03
- Kimi K2.7 Code · 编程模型与 HighSpeed 说明(官方来源,新窗口)
Moonshot AI · 核对于 2026-09-03
资料核对日期:2026-09-03。本文为官方文档的中文对照与编辑分析,并非同条件模型实测;规格、可用性与价格可能变化,不代表聊天会员套餐权益。