内容来源于网络,若不便发表,请联系后台删除;文章仅用于研究参考,不构成任何投资建议,投资有风险,入市需谨慎。
Deepseek官方表示:受限于高端算力,目前Pro的服务十分有限,预计下半年昇腾950超节点批量上市后,Pro的价格会大幅下调。
今年是国产超节点大规模落地的元年,以华为昇腾为代表的国产超节点有望在新一代MoE模型的推理场景率先落地。国产AI芯片和交换芯片有望通过超节点技术的突破迎来新的增量。受到生成式AI需求的驱动,服务器CPU率先出现供给短缺和价格上涨,有望进一步驱动国产CPU在数据中心领域的商业化。在新一代国产AI芯片、超节点快速落地的背景下,国内模型侧的算力需求有望更多地向国产算力倾斜。随着国产算力在性能和性价比上不断提升,下游客户在订单层面有望看到实质性进展,行业头部企业有望迎来高确定性增长。
1、全球AI产业的发展重心正从模型训练转向应用推理。所有硬件与软件的演进方向都指向应对推理需求的爆发。训练与推理对算力的需求截然不同,其落地形式也因此分化。
- 训练时代的算力落地形式是超大规模集群,通常由成千上万甚至十万张加速卡组成。其核心特征有二:一是规模庞大,以处理海量数据;二是高度稳定,确保长时间不间断运行以完成训练任务。规模化是训练时代算力落地的最重要特征。
- 推理时代则完全不同。推理任务不需要超大规模集群,因为用户请求是分散且实时的,并发量有限。因此,规模化并非推理算力的主要特征。推理对算力的核心需求是低延迟,即快速响应用户的每一次请求。
2、为了达成低延迟目标,产业界在技术和架构上进行了一系列针对性革新。首先是芯片设计,出现了PD分离与LPU。PD分离是将推理过程拆分为Prefill和Decode两个阶段,由专用芯片分别优化。英伟达率先提出了这一理念,但其实现产品Rubin芯片预计在今年第四季度才能出货。华为的昇腾950PR已成为全球首款实现PD分离的芯片,专司Prefill阶段。华为在今年四季度还将推出配套的Decode芯片950DT。这相当于英伟达提出理念,华为率先实现。无论是华为还是英伟达,其设计目标都是服务于推理,实现低延迟。
LPU是一种专为推理设计的芯片,其核心是在算力芯片上集成大容量SRAM存储,主要目的就是极速生成第一个Token,以解决用户感知最明显的“开头卡顿”问题。当模型吐出第一个Token后,后续的生成速度会加快。因此,LPU是典型的推理时代芯片,其根本目标同样是降低延迟。
3、低延迟是推理时代的第一个核心特征,第二个特征是算力池化,即在一个由几十或几百张卡组成的紧凑集群内,所有计算和存储资源被打通成一个资源池。通过RDMA等技术,允许一个服务器的计算单元直接读取另一个服务器的存储单元,绕过不必要的中间步骤,从而大幅减少数据访问延迟。这对于当前主流的MoE架构尤为重要,因为不同用户请求可能激活不同的“专家”模型,需要跨服务器快速交互数据。算力池化的根本目标也是为了实现低延迟。
4、综合上述技术,推理时代算力落地的核心物理形态就是“超节点”。超节点是由几十张到几百张加速卡组成的紧凑型高性能计算集群。它区别于训练所需的“万卡集群”,规模更小,但内部互联速度和资源调度效率要求极高。它集成了PD分离芯片、LPU、算力池化、以及CPO、OCS等高速光互联技术,一切设计都围绕着满足推理的低延迟需求。例如,谷歌的OCS就典型地应用于其由64张TPU v5p组成的超节点(Cube)之中。
5、产业格局上,超节点的理念由英伟达率先提出,但由华为最先实现商业化落地。目前,英伟达、华为、阿里云、谷歌等巨头均已推出或正在部署各自的超节点解决方案。
6、为什么今年是国产超节点的关键元年?这是当前市场的核心逻辑。此前,尽管AI推理需求火热,但国产AI算力板块的表现与之脱节,核心原因在于 “有需求,但产品不对路” 。
老一代国产卡,如华为的昇腾910B/C、寒武纪思元590等,主要面向训练优化,存在明显短板:不支持FP8/FP4数据格式(现代大模型推理的主流精度),且无法很好地支持超节点架构。因此,难以高效承载大规模的深度推理任务。
然而今年推出的新一代国产芯片实现了关键跨越。它们全面支持超节点架构,并且支持FP8/FP4新一代数据格式。代表性产品包括:华为昇腾950系列(已发布的950PR及未来的950DT)、寒武纪思元690、海光信息深算四号。这意味着,从今年开始,国产AI芯片首次具备了支撑大模型深度推理的完备硬件能力。华为950PR的面世,可视作行情启动的标志。
预计今年国产AI芯片出货量将显著增长,整体可能达到百万张级以上。随着推理需求的指数级增长,一旦国产超节点方案被验证跑通,明年出货量有望迎来更急剧的放大。从投资角度看,核心是围绕能提供支持超节点和新数据格式的国产AI芯片公司及其核心生态伙伴。
—END—
本文作者可以追加内容哦 !