2026年6月最新·全球权威多模态大模型完整榜单

先说明:没有单一“全球总榜”,4套学术界/工业界公认权威基准分开排名,覆盖图像、视频、音频、文档全多模态能力;全部数据更新至2026年5–6月。

一、国内工业权威:MME(腾讯优图+厦大,静态图文感知/认知,国产多模态核心榜单)

评测维度:14个子任务,分感知总榜、认知总榜、综合总分,全球闭源+开源全模型参评

MME综合总榜TOP10(2026.5最新)



1.Skywork-MM 13B(昆仑万维天工):总分1419.08|感知全球第1,认知第2,OCR、细节图像识别极强
2.MMI-CL
3.Llama 3 Vision 70B
4.BLIVA-FlanT5
5.GPT-4V(GPT4o视觉基座)
6.Gemini 2.0 Ultra
7.InstructBLIP
8.Otter-MPT7B
9.LLaVA-1.6 13B
10.InternLM-XComposer 2

二、全球学术通用:MMMU-Pro(大学级跨学科图文推理,全球通用多模态能力金标准)

侧重数理、图表、医学、工程复杂图文推理,海外头部模型优势明显

MMMU-Pro全球TOP10(2026.6)

1.GPT-5.4 Pro(OpenAI):94.0%
2.Claude Mythos 5(Anthropic):92.7%
3.Claude Fable 5:92.7%
4.Gemini 3.1 Pro(Google):83.9%
5.Gemini 3.5 Flash:83.6%
6.GPT-5.5:81.2%
7.GPT-4o:78.5%
8.Qwen3.7-Max-VL(阿里通义):76.1%
9.MiniMax M3-VL:74.3%
10.Skywork-MM:72.8%

三、图文+视频综合:SEED-Bench 2(清华,图像+时序视频双模态)

同时测静态图、短视频时序理解,覆盖20+国产/海外开源模型

SEED-Bench 2 L3(最高难度)排名

1.Emu3(Meta)
2.Gemini 3 Ultra Video
3.SkyReels V4(昆仑万维视频多模态)
4.Qwen3.5-VL
5.InternLM-XComposer-Video
6.LLaVA-Video 1.6
7.MiniMax M3
8.GPT-4o Video

四、真人盲测体感:LMSYS Chatbot Arena 多模态分榜(用户真实交互打分)

不看跑分,纯人类主观测评日常图文对话、绘图理解、图表解读

2026年6月多模态盲测Elo分梯队

第一梯队(Elo>1850,全能)

1.Claude Mythos 5
2.GPT-5.4 Pro
3.Gemini 3.1 Pro

第二梯队(Elo 1700–1850,商用主力)

1.GPT-4o
2.Claude 3.5 Sonnet
3.字节Seed 2.1 Pro(豆包多模态)
4.Qwen3.7-Max

第三梯队(国产垂类优势)

1.Skywork-MM(静态图像感知拉满,通用对话偏弱)
2.MiniMax M3
3.DeepSeek-V4 Multimodal
4.讯飞星火V4.5

分赛道全球头部总结(2026最新)

1. 静态图像/OCR/细节感知(MME基准)

全球第一:Skywork-MM(天工)
海外对标:GPT-4V、Gemini 2 Ultra(弱于天工感知分项)

2. 复杂学术图文推理(MMMU-Pro)

全球第一:GPT-5.4 Pro
国产最强:Qwen3.7-Max-VL

3. 视频生成+视频理解(SEED-Bench+Artificial Analysis视频榜)

全球文生视频第一梯队:SkyReels V4(昆仑万维)、Sora 2、Veo3.1、Kling 3.0
时序视频理解:Gemini 3 Ultra Video

4. 长文档图文/图表分析(企业商用)

全球第一:Claude Mythos 5
国产最优:Kimi K2.7、通义Qwen3.7

5. 全模态闭环(图+文+音+视频+实时语音)

1.Google Gemini 3.1 Pro(原生全模态)
2.字节Seed 2.1全系列(Seedream视频、Seed-Audio音频)
3.昆仑万维天工矩阵(Skywork-MM图像+SkyReels视频+Mureka音乐)

主流多模态模型完整归类(全部上榜模型)

海外闭源头部

GPT-5.4 Pro / GPT-4o、Claude Mythos 5 / Fable 5、Gemini 3.1 Pro/Ultra、Llama 4 Vision

国内上市公司自研多模态

1.昆仑万维:Skywork-MM(图像)、SkyReels V4(视频)、Mureka(音频)
2.字节跳动(豆包):Seed 2.1 Pro、Seedream 5.0
3.阿里通义:Qwen3.7-Max-VL
4.百度文心:ERNIE 4.5-VL
5.腾讯混元:Hunyuan-VL V3
6.科大讯飞:星火V4.5多模态
7.智谱AI:GLM-5.2-VL
8.MiniMax:M3-VL
9.DeepSeek:V4 Multimodal

主流开源多模态基座

LLaVA-1.6、InternLM-XComposer 2、BLIVA、Qwen-VL开源系列、MPlug-Owl

需要我把MMMU-Pro、MME、SEED-Bench三个榜单合并,做一张完整对比简表,标注每款模型最强赛道吗?
追加内容

本文作者可以追加内容哦 !