返回 Agent 博客
模型对比官方资料对照 · 非实测排名

多模态对比:GPT、Grok、Gemini、DeepSeek、Kimi 能看什么、生成什么

看图不等于画图,读取视频不等于生成视频。按指定模型逐项核对输入与输出,单独标注 DeepSeek 视觉实验模型,以及需要另接生成工具的情况。

光学棱镜连接图像、声波与胶片,象征 AI 多模态输入输出
模享概念配图 · 非原文截图

本文基于官方资料整理,核对日期为 2026-09-03;并非原文全文翻译,也不是同条件模型实测。正文区分文档事实与编辑建议,来源可通过编号查阅。

SOURCE NOTES

对比要点

  • 模型能够理解图片,不代表其原生输出就是图片。GPT-5.6 Sol 与 Grok 4.6 的模型卡将图像列为输入,正文输出为文本。[1][2]
  • Gemini 3.8 Flash 可以接收多种媒体,但模型页明确不支持原生图像或音频生成;需要生成内容时应检查专门的模型或工具。[3]
  • DeepSeek 的视觉入口是 deepseek-v4-flash-vision-exp,其他非视觉模型不能直接接收图像。Kimi K3 的接入说明提供图像和视频消息示例。[4][5]

关键差异对照

窄屏可左右滑动查看完整表格。

输入理解与生成输出分开比较;“未核验”不等于品牌没有该能力
模型已核验输入输出/限制来源
GPT-5.6 Sol文本、图像原生文本输出;图像生成是另接工具[1]
Grok 4.6文本、图像模型卡标示文本输出[2]
Gemini 3.8 Flash文本、图像、视频、音频、PDF文本输出;非图像/音频生成模型[3]
DeepSeek V4-Flash-Vision-Exp图像与文本视觉实验入口;不要改用普通 V4 slug[4]
Kimi K3视觉理解;图像、视频接入示例本次不将其计为原生图像生成器[5]

模享解读 · 非原文观点

先说清你要读媒体,还是创建媒体

从一张发票里抽取金额,和根据提示生成一张海报,是两种任务。选型时可以把需求写成“输入格式 → 目标输出”,例如“会议录音 → 带时间信息的摘要”,再确认接入方式是否支持,而不是只看“多模态”三个字。

我们建议用同一批图像或音视频测试细节:小字能否读清,图表单位是否准确,视频中的事件顺序是否颠倒。任何媒体预处理都应记录,包括缩放、抽帧和转写;否则你测到的可能是预处理流程,而非模型差异。

可以从这份清单开始

  1. 把输入理解与原生生成列成两项。
  2. 标记实验模型及媒体上传限制。
  3. 保持缩放、抽帧、转写条件一致。
  4. 对小字、单位、时序和缺失信息设置验收题。

来源与说明

以下为本次实际查阅的官方资料。核对日期不是每份文档的发布日期;规格及价格是当日快照。文中的用途建议、算例与实践清单为模享整理,不代表来源机构立场。

  1. GPT-5.6 Sol · 模型规格与价格(官方来源,新窗口)

    OpenAI · 核对于 2026-09-03

  2. Grok 4.6 · 模型规格(官方来源,新窗口)

    xAI · 核对于 2026-09-03

  3. Gemini 3.8 Flash · 模型规格(官方来源,新窗口)

    Google · 核对于 2026-09-03

  4. Vision · 视觉实验模型的输入要求(官方来源,新窗口)

    DeepSeek · 核对于 2026-09-03

  5. Kimi K3 · 官方接入与能力说明(官方来源,新窗口)

    Moonshot AI · 核对于 2026-09-03

资料核对日期:2026-09-03。本文为官方文档的中文对照与编辑分析,并非同条件模型实测;规格、可用性与价格可能变化,不代表聊天会员套餐权益。