10月5日,国际大模型竞技场LMArena最新文生图榜单出炉,在全球26个主流大模型的用户盲测中,腾讯混元图像3.0强势登顶,包揽“最佳综合文生图模型”与“最佳开源文生图模型”两项桂冠,力压Seedream 4和代号“nano-banana”的Gemini 2.5 Flash Image Preview等国际劲旅。这波操作,属实有点东西。
这次评测由加州大学伯克利分校推出的LMArena平台主导,主打一个“真实体验”——全靠人类用户盲选打分,不看参数、不拼宣传,就看谁生成的图更对眼。评测维度包括图像准确性、细节还原、艺术表现力和文本渲染能力。结果很直接:混元图像3.0赢麻了。LMArena官方都忍不住发帖:“文生图排行榜大洗牌!腾讯混元图像3.0登顶竞技场——同时被评为最佳综合文生图模型与最佳开源文生图模型。这款图像生成模型已超越Seedream 4,以及代号‘nano-banana’的Gemini 2.5 Flash Image Preview。重大突破,恭喜腾讯混元。”
我们拆了下腾讯的回应,他们总结了三个“硬本事”:一是会“思考”,不是照字面画画,而是能调用世界知识做推理,把物理逻辑、常识关系融进画面;二是画得“精准”,中英文长文本渲染不糊,海报标语、小字注解都能清晰落地;三是有“审美”,复杂指令也能读懂,出图质感在线,不用反复“重生成”就能交差。这说明什么?腾讯在多模态理解、语义推理这块,底子是真的厚。
关键点来了:混元图像3.0是开源的。2025年9月28日正式发布后,立马冲上Hugging Face开源社区热榜第一,霸榜整整一周。它是首个开源的工业级原生多模态生图模型,也是目前效果最好的开源文生图方案。此前9月初开源的图像2.1版本已是性能最强的开源模型之一,这才一个月出头,3.0直接完成技术超车,迭代速度拉满。
目前,混元图像3.0已开放文生图能力,图生图、图像编辑、多轮交互等功能正在路上,采用渐进式开源策略——既保证稳定性,又留足开发者共建空间。整个混元系列早已不只是“一个模型”,而是覆盖语言、图像、视频、3D的多模态开源矩阵。衍生模型总数超3000个,混元3D系列下载量突破260万次,是全球最受欢迎的3D开源模型家族。
横向看,腾讯混元在生成式AI多个赛道都在刷榜。2025年8月,上海人工智能实验室发布的全球3D生成模型评测显示,混元3D在图生3D和文生3D任务中均排名第一;其世界模型Voyager更是在斯坦福大学WorldScore基准测试中拿下综合能力第一。这已经不是单点突破,而是系统性领先。
现在AI竞争早就过了“谁家模型大”的阶段,拼的是性能、开源程度和社区生态。混元图像3.0这一登顶,不只是技术胜利,更是中国AI开源生态走向全球舞台中心的一个信号。我们对这个方向非常坚定——真正的技术影响力,永远来自开放、共享和持续创新。
本文作者可以追加内容哦 !