经济观察网 深夜重磅!马斯克发布最强Grok 4.5,Opus级性能价格大跳水 马斯克深夜掀桌!最强旗舰Grok 4.5突然上线,凭借数万块GB300芯片打造出性价比之王,不仅正面硬刚GPT-5.5,性能紧贴Opus 4.8,而且速度更快、成本更低。Grok 4.5,终于交卷! 就在刚刚,SpaceXAI正式发布了史上最强旗舰模型Grok 4.5。这次,SpaceXAI与Cursor强强联手,依托数万块GB300的强大算力,打造出一款专为编码和智能体设计的性能怪兽。其成绩单相当亮眼:SWE Bench Pro得分64.7%,超越Opus 4.7的64.3%;Terminal Bench 2.1飙升至83.3%;DeepSWE 1.0达到62.0%,表现优于Opus 4.8。 马斯克表示,“Grok 4.5大致相当于Opus 4.7,但快得多”。能力、速度与成本三者的结合,构成了它的核心竞争力。这意味着,它完成任务所需的Token量远低于对手。Grok 4.5的输入价格为每百万Token 2美元,输出价格为每百万Token 6美元。与Opus 4.8相比,Token消耗减少了4.2倍。 数万块GB300芯片,炼就了一款“Opus级”的Grok 4.5,这是SpaceXAI上市后的首张王牌,也是与Cursor合作的首份成果。那么,它是如何诞生的?答案是,通过数以万计的英伟达GB300 GPU进行超大规模训练。不过,单纯堆砌算力只是基础。 马斯克预告:下周Grok 4.5的上下文将升级至100万。SpaceXAI真正下功夫的地方在于数据。他们对海量语料进行了严格的过滤、去重和质量评估,确保输入模型的每一份数据都具备高信息密度的专业内容。随后,他们将强化学习的重点放在了一个较少被提及的指标上——“单Token智能度”。而Cursor的加入,则是这套体系中最关键的一环。 Grok 4.5基于V9(1.5T)底座,官方称训练时使用了数以万亿计的Cursor数据。这些数据记录了真实开发者与代码库、工具及智能体的交互过程。这意味着,模型不仅学习了“代码的形态”,更理解了“人与AI协作编写代码”的方式。其训练栈专为高度异步设计:智能体可连续运行数小时,模型在运行中持续学习,数万块GPU上的训练从未间断。结果就是,它不仅能解题,还能在长达数小时的复杂任务中,处理多步骤的工程难题。 打平GPT-5.5,逼近Opus 4.8。这套训练方法下的Grok 4.5,硬核性能经得起考验。在多个核心工程榜单上,它的表现相当稳健——虽非最强,但已跻身第一梯队。DeepSWE 1.0上,它获得62.0%,超过Opus 4.8的55.75%,紧追GPT-5.5的64.31%;Terminal Bench 2.1上,它达到83.3%,与GPT-5.5的83.4%仅差0.1%;SWE Bench Pro上,它以64.7%的解决率反超GPT-5.5的58.6%,逼近Opus 4.8的69.2%。在AAAI官方测试中,Grok 4.5排名第四,仅次于Fable 5、GPT-5.5和Opus 4.8。在Harvey法律智能体基准测试中,它位列第一。这份成绩单确实亮眼。但必须承认,当前最强的依然是Claude Fable。总体而言,Grok 4.5与GPT-5.5基本持平,紧贴Opus 4.8,但与顶尖水平仍有差距。马斯克也坦言:“我们内部评估认为,Grok 4.5大致与Opus 4.7相当,但快得多。” 真正的杀手锏:又快又便宜。Grok 4.5的真正优势体现在速度、效率和价格上。其推理速度达到80 TPS,官方称“比flash类模型还快”。仅凭一句指令,它就能用Three生成一个太阳系3D模拟器:支持时间加速,八大行星轨道运动逼真,HUD面板也设计得相当精致。效率方面,在SWE Bench Pro任务中,Grok 4.5平均仅输出15,954个Token就解决了问题。而Opus 4.8完成相同任务,平均需要67,020个Token。这意味着,Grok 4.5用了不到对手四分之一的Token,就完成了同样的工程任务。价格上,输入每百万Token 2美元,输出每百万Token 6美元。此外,还有一个更快的高级版本,定价为输入4美元、输出18美元。相比其他动辄十几美元起步的顶级模型,这个价格几乎将成本压到了最低。这三个数字叠加,结论显而易见:在“单位时间、单位成本能获得多少智能”方面,Grok 4.5目前堪称“性价比之王”。 全网实测:Grok 4.5真实表现。从网友的实测反馈中,可以窥见Grok 4.5的真实能力。一句指令,就能生成“我的世界”。在一个单独的HTML文件中,Grok 4.5能轻松完成一个完整的高端SaaS页面。它还能在应用内不到一分钟内,完成整套2D+3D设计方案。AI游戏开发者Danny Limanseta用Grok 4.5生成了一款功能齐全的游戏。不过,也有开发者指出,Grok 4.5与Opus 4.7不在同一水平,生成的熔岩灯测试效果不佳。 不是最强,憋着下个月掀桌。今天,马斯克又埋下了一颗“雷”:Grok深谙工程之道。下个月的版本将迎来又一次阶跃式提升,因为团队正在特斯拉、SpaceX、Neuralink和Boring Company中,闭合解决真实工程问题的闭环。下个月,将再次实现阶跃。此外,据传一个2万亿参数的更大版本已在开发中。跑分只是给外行看的烟花;效率与成本,才是将对手拖入消耗战的真枪实弹。当模型的智能像电力一样按度计费时,胜负的关键就在于谁能让智能变得更快、更便宜、更普及。这一次,马斯克虽未打出最强的牌,却掀翻了整个牌桌。

(作者 全球科技局)

追加内容

本文作者可以追加内容哦 !