模型对比官方资料对照 · 非实测排名
多模态对比:GPT、Grok、Gemini、DeepSeek、Kimi 能看什么、生成什么
看图不等于画图,读取视频不等于生成视频。按指定模型逐项核对输入与输出,单独标注 DeepSeek 视觉实验模型,以及需要另接生成工具的情况。

本文基于官方资料整理,核对日期为 2026-09-03;并非原文全文翻译,也不是同条件模型实测。正文区分文档事实与编辑建议,来源可通过编号查阅。
SOURCE NOTES
对比要点
关键差异对照
窄屏可左右滑动查看完整表格。
模享解读 · 非原文观点
先说清你要读媒体,还是创建媒体
从一张发票里抽取金额,和根据提示生成一张海报,是两种任务。选型时可以把需求写成“输入格式 → 目标输出”,例如“会议录音 → 带时间信息的摘要”,再确认接入方式是否支持,而不是只看“多模态”三个字。
我们建议用同一批图像或音视频测试细节:小字能否读清,图表单位是否准确,视频中的事件顺序是否颠倒。任何媒体预处理都应记录,包括缩放、抽帧和转写;否则你测到的可能是预处理流程,而非模型差异。
可以从这份清单开始
- 把输入理解与原生生成列成两项。
- 标记实验模型及媒体上传限制。
- 保持缩放、抽帧、转写条件一致。
- 对小字、单位、时序和缺失信息设置验收题。
来源与说明
以下为本次实际查阅的官方资料。核对日期不是每份文档的发布日期;规格及价格是当日快照。文中的用途建议、算例与实践清单为模享整理,不代表来源机构立场。
- GPT-5.6 Sol · 模型规格与价格(官方来源,新窗口)
OpenAI · 核对于 2026-09-03
- Grok 4.6 · 模型规格(官方来源,新窗口)
xAI · 核对于 2026-09-03
- Gemini 3.8 Flash · 模型规格(官方来源,新窗口)
Google · 核对于 2026-09-03
- Vision · 视觉实验模型的输入要求(官方来源,新窗口)
DeepSeek · 核对于 2026-09-03
- Kimi K3 · 官方接入与能力说明(官方来源,新窗口)
Moonshot AI · 核对于 2026-09-03
资料核对日期:2026-09-03。本文为官方文档的中文对照与编辑分析,并非同条件模型实测;规格、可用性与价格可能变化,不代表聊天会员套餐权益。