什么是AI算力集群?

近些年,AI浪潮席卷全球,成为全社会瞩目的焦点话题。

每当人们谈起人工智能,AI算力集群这个关键词就会频繁出现。AI有三大核心要素,分别是算力、算法与数据,而AI算力集群,恰恰是当前最主要的算力来源。它好比一座超级”能量站”,为高速发展的的AI行业持续输送着动力。

什么是AI算力集群?

AI算力集群,顾名思义,就是能够承载AI计算任务、持续输出算力的集群体系。集群,英文写作cluster,指的是一批彼此独立、借助高速网络相互连通的设备集合。

从行业定义来看,AI算力集群是指”通过高速网络,将海量高性能计算节点(如GPU/TPU服务器)互联起来,进而构成的一种分布式运算体系”。

在AI智算的应用场景中,核心任务无非两类:训练与推理。训练对算力的消耗极为庞大,难度也更高;推理的运算量相对有限,对算力的依赖程度也相应较低。

无论哪类任务,都离不开大规模的矩阵运算(如卷积、张量乘法)。这类计算天然适合拆解为并行子任务分头处理。因此,擅长并行运算的GPU、NPU、TPU等芯片便成为AI计算的核心工具,统称为AI芯片。

AI芯片是产生AI算力的基本单元,但单颗芯片无法独立运作,必须集成到电路板上才能发挥作用。

将AI芯片嵌入手机主板,或直接整合进手机SoC主芯片,便可赋予手机AI运算能力;集成于物联网设备模组中,则能为汽车、机械臂、AGV无人车、摄像头等终端设备提供算力支撑——这些统称为端侧算力。将AI芯片内置于基站、路由器、网关等设备中,则属于边缘侧算力。

上述设备体积紧凑,通常只配置一颗AI芯片,算力有限,主要承担推理类计算任务。

若要完成更为繁重的训练任务,则需要一个可容纳更多AI芯片的硬件平台。

将AI芯片制成算力板卡,再向一台服务器中嵌入多块算力板卡,便造就了AI服务器。本质上,AI服务器是普通服务器叠加多块AI算力板卡的产物。

通常情况下,AI服务器采用”一机八卡”的配置。若强行扩充,部分机型最多可容纳二十块卡,但受散热与功耗的制约,进一步堆叠便难以为继。

此阶段的AI服务器算力已跃升一个量级,驾驭推理任务游刃有余,也能勉强应对一些规模较小的模型训练。

今年崭露头角的DeepSeek大模型,凭借架构与算法层面的深度优化,将算力门槛大幅拉低。由此催生出一类单机架计算设备——集成若干台AI服务器、存储及电源,厂商将其冠名为”一体机”,可满足大量行业用户私有化部署DeepSeek的需求,市场反响相当热烈。

但无论是AI服务器还是一体机,其算力终究有限。面向真正意义上的超大规模参数(千亿级、万亿级)模型训练,仍须构建承载更多AI芯片的系统,也就是真正的大规模AI算力集群。

如今我们常听到”万卡规模””十万卡规模”这样的说法,意指目标集群需要配置一万块乃至十万块AI算力板卡(即AI芯片)。

这该怎么实现?答案归结于两条路径:Scale Up与Scale Out。

什么是Scale Up?

Scale意为扩展,是云计算领域的常见术语。Scale Up,即向上扩展,也称纵向扩展,指的是提升单一节点的资源容量。Scale Out,则是向外扩展,也称横向扩展,指的是增加节点的数量。(云计算中还对应着Scale Down和Scale In,分别代表纵向与横向的缩减。)

前文所说的在单台服务器中增配AI算力板卡,便是Scale Up的典型体现,此时一台服务器即构成一个计算节点。而通过通信网络将多台计算机(节点)串联起来,便是Scale Out。

什么是Scale Up
什么是Scale Up

Scale Up与Scale Out最本质的差异,体现在AI芯片之间的互联带宽上。

Scale Up属于节点内部连接,互联带宽更高、时延更低、性能更强劲。

早期,计算机内部组件间的通信依赖PCIe协议,该协议诞生于上世纪八九十年代PC普及之初,尽管历经多次迭代,但升级节奏迟缓,传输速率与时延均难以契合AI计算的苛刻需求。

为此,英伟达于2014年推出了专有总线协议NVLINK。NVLINK支持GPU之间以点对点方式直连通信,速率远超PCIe,时延也显著更低。

图片来自:英伟达官网
图片来自:英伟达官网

NVLINK最初仅用于机器内部的互联。2022年,英伟达将NVSwitch芯片独立成型,打造成NVLink交换机,用于跨服务器的GPU设备互联。

由此,计算节点不再局限于单台服务器,而是可由多台服务器与网络设备共同构成,处于同一个HBD(High Bandwidth Domain,超带宽域)之内。英伟达将这种以超大带宽实现16卡以上GPU间互联的Scale Up体系,称为超节点。

经过多年迭代,NVLINK已演进至第五代。每块GPU配备18路NVLink连接,Blackwell GPU的总带宽可达1800GB/s,远超PCIe Gen6的总线带宽上限。

2024年3月,英伟达发布NVL72,可将36颗Grace CPU与72颗Blackwell GPU集成于单个液冷机柜之中,实现总计720 Pflops的AI训练性能,或1440 Pflops的推理性能。

英伟达是AI计算领域毋庸置疑的领军者,拥有最受市场认可的AI芯片(GPU)与软件生态(CUDA),也探索出了目前最成熟的Scale Up实现路径。

随着AI赛道持续升温,越来越多的企业相继推出了自研AI芯片。由于NVLINK属于私有协议,这些厂商也需要另辟蹊径,探索构建自有AI算力集群的方案。

英伟达海外的主要竞争对手之一AMD推出了UA LINK;国内的腾讯、阿里、中国移动等企业也牵头推进了ETH-X、ALS、OISA等开放项目。

什么是AI算力集群?

这些均为开放标准,成本比私有协议更具优势,有助于拉低行业门槛,推动技术普惠,也与互联网开放解耦的发展趋势一脉相承。值得关注的是,上述标准大多以以太网技术(ETH)为底座,原因在于以太网技术最为成熟开放,产业链根基深厚。

另一条颇具关注价值的技术路线,是华为的私有协议UB(Unified Bus)。

近年来,华为持续深耕昇腾生态。昇腾是其自研AI芯片,目前已迭代至昇腾910C。华为同样需要与之配套的AI算力集群解决方案,以最大化释放910C的运算潜力,并为市场推广奠定基础。

CloudMatrix384采用了UB技术作为支撑,准确来说包含三个独立网络平面——UB平面、RDMA平面与VPC平面,三者协同互补,大幅提升了卡间通信能力,也整体拉升了超节点的算力输出。受篇幅所限,详细技术细节留待后续专文介绍。

此外值得补充的是,面对开放标准带来的竞争压力,英伟达近期公布了NVLink Fusion计划,向8家合作伙伴开放了NVLink技术,协助其构建基于多芯片互联的定制化AI系统。不过据部分媒体报道,若干关键NVLink组件仍未完全开放,英伟达在这一问题上态度尚显保守。

什么是Scale Out?

Scale Out,实质上更接近我们熟悉的传统数据通信网络范畴。将普通服务器互联所依赖的胖树架构、叶脊网络架构,以及TCP/IP、以太网等基础技术,都构成了Scale Out的底层支撑。

当然,AI智算对网络性能的要求远比传统应用苛刻,传统技术也必须升级,方能达到门槛。

目前,Scale Out领域主流采用的通信网络技术是Infiniband(IB)与RoCEv2,两者均基于RDMA(远程直接内存访问)协议,相比传统以太网在速率、时延和负载均衡等维度均有显著提升。

IB当年的初衷也是替代PCIe,后来几经沉浮,掌握这一技术的Mellanox(迈络思)被英伟达并购,IB随之成为英伟达的私有技术。该技术性能卓越,但价格同样不菲,是英伟达算力版图的重要组成部分。

RoCEv2则是开放标准,是传统以太网融合RDMA的衍生产物,也是业界抗衡IB一家独大而推出的替代方案,价格更为亲民,与IB的性能差距也在持续收窄。

与Scale Up领域多标准并存的局面不同,Scale Out目前的标准相对集中,主流方向基本锁定为RoCEv2,路线清晰明朗。这也不难理解——Scale Up属于节点内部互联,与芯片产品高度绑定;Scale Out属于节点间互联,更侧重通用兼容性。

从带宽数值来看,IB与RoCEv2目前仅能提供Tbps量级的带宽;而Scale Up可在数百颗GPU之间实现10Tbps量级的互联速率,差距相当悬殊。在时延方面,两者同样分野明显:IB与RoCEv2的时延在10微秒左右,而Scale Up对网络时延的要求极为严苛,须达到百纳秒(即0.1微秒)级别。

在AI训练过程中,通常并行运用多种并行计算策略,包括TP(张量并行)、EP(专家并行)、PP(流水线并行)以及DP(数据并行)。一般而言,PP与DP的通信量相对可控,通常交由Scale Out承接;TP与EP的通信量庞大,则需要依托Scale Up(超节点内部)来完成。

什么是AI算力集群?

超节点作为Scale Up当前最优的落地形态,借助内部高速总线互联,能够有效支撑并行计算任务,加快GPU之间的参数交换与数据同步,从而显著压缩大模型的训练周期。

超节点通常还具备内存语义能力,GPU之间可直接访问对方的内存空间,这也是Scale Out所不具备的。

从组网与运维的视角来看,更大规模的Scale Up同样具备明显优势——超节点的HBD越大、Scale Up侧的GPU数量越多,Scale Out的组网就越趋于简化,可大幅降低网络部署的复杂度与周期,后期运维也更为便捷。

什么是AI算力集群?

当然,Scale Up并非可以无限扩张,成本因素同样是不可忽视的边界条件,具体规模须结合应用场景进行测算。

概括而言,Scale Up与Scale Out,本质上是性能与成本之间的动态平衡。随着时间推移与技术演进,更大规模的超节点将陆续涌现,Scale Up与Scale Out之间的边界也将日渐模糊。

前文提及的ETH-X等开放Scale Up标准均以以太网技术为底座,从技术可行性来看,以太网已具备最大交换芯片容量(单芯片51.2T已实现商用)、最高速Serdes技术(目前达到112Gbps),交换芯片时延也低至200ns,完全能够满足Scale Up的性能诉求。而Scale Out同样基于以太网,二者有望殊途同归,走向大一统。

AI算力集群的发展趋势

最后,梳理一下AI算力集群当前几个值得关注的趋势动向。

一是物理空间的异地分布化。 AI算力集群正向万卡、十万卡规模迈进。英伟达NVL72单个机架容纳72颗芯片,华为CM384以16个机架集成384颗芯片。若华为基于CM384构建十万卡集群,需要432套(384×432≈165888颗),对应约6912个机架。单体数据中心难以容纳如此体量,电力供给同样面临瓶颈。因此,业界正在积极探索多地数据中心协同组成AI算力集群、合力完成训练任务的模式,这对长距离、大带宽、低时延的DCI光通信技术提出了更高要求,也将进一步加速空芯光纤等前沿技术的规模化落地。

二是节点架构的深度定制化。 以往讨论AI集群,焦点往往集中在如何堆叠更多芯片。而今,架构层面的精细设计愈发受到重视——计算资源(GPU、NPU、CPU,乃至内存、存储)的池化趋势日益显著,集群需要深度适配AI大模型的架构特征(如MoE架构),提供量身定制的设计方案,方能充分发挥算力潜能。换言之,单纯提供AI芯片已不再足够,还需要给出贴合需求的整体解决方案。

三是运维管理的智能化。 AI大模型训练过程中容易出现故障,严重时数小时便可能中断一次,一旦出错就需要从头重算,不仅拉长训练周期,也大幅抬升训练成本。为此,企业在构建AI算力集群时,越来越重视系统的稳定性与可靠性,借助AI技术提前研判潜在故障、主动替换亚健康设备或模块,正在成为主流做法。这类举措有助于压低故障率与中断率,在提升系统稳定性的同时,也间接放大了有效算力产出。

四是算力供给的绿色低碳化。 AI智算对算力的消耗庞大,随之而来的能耗问题同样不容忽视。目前,各大厂商都在积极探索降低AI算力集群能耗的方法,持续提升绿色能源的使用比例,这对于AI智算的可持续发展至关重要。我国推进的”东数西算”战略,也有着同样的政策考量与目标导向。

以上便是关于AI算力集群的系统性梳理,涵盖了从基本概念、核心架构到技术路线与发展趋势的主要内容。

原创文章,作者:余初云,如若转载,请注明出处:https://blog.jidcy.com/jsjc/3049.html

Like (0)
Previous 2026年6月29日 上午9:17
Next 2026年6月29日

相关推荐

  • oss对象存储服务是什么?

    高效地处理大规模数据已经成为许多企业的核心需求​​​​​​​,企业正日益借助大规模的对象存储来打造企业级数据池与智能存储服务,存储系统正朝着更具弹性、更高效、更智能的方向迈进,以契…

    2026年6月9日
    0
  • 网络防火墙是什么?

    防火墙是什么? 防火墙是搭建在不同网络区间,例如可信企业内网与陌生公共网络,或是各类网络安全分区之间的设备组合体系。它能够管控、筛查并调整往来数据流,对外隐藏内网数据、架构与运行情…

    2026年5月25日
    0
  • 服务器接入高防IP后有哪些作用?

    什么是高防IP?高防IP是由高防数据中心所提供的IP地址段,主要面向网络服务器在遭遇大规模DDoS攻击时所提供的防护服务。高防IP是当前最为普遍的一种抵御DDoS攻击的方式,用户可…

    2026年6月4日
    0
  • 什么是静态 IP 地址?

    静态 IP 地址保持一致且可预测,不会被路由器或互联网服务提供商(ISP)自动重新分配,因此适用于托管服务、远程访问和企业网络。 静态 IP 地址在实践中有哪些用途?很多时候,它能…

    2026年5月16日
    0
  • 【余初云】云等保等级安全建设

    云计算等级保护是整个等保2.0的组成部分,它与等级保护的”通用”部分构成一个整体,来规范云计算的等级保护建设,为云计算平台网络安全建设设定基线。一方面做好物…

    2026年6月18日
    0
  • 什么是风险评估?什么是等保测评?

    一、什么是等保? 网络安全等级保护是指对网络(含信息系统、数据等)实施分等级保护、分等级监督,对网络中发生的安全事件分等级响应、处置。 二、为什么要做等保? 1.从法律要求层面来说…

    2026年5月22日
    0
  • web应用防火墙主要防护什么

    Web 应用防火墙(Web Application Firewall,简称 WAF)能够为您的网站或 App 业务构建全方位的 Web 应用安全屏障。 Http(S) 请求在抵达源…

    2026年6月17日
    0
  • 网站SSL安全加密安装常见问题及解决方法

    在用户需求日益提高的当下,如果您的网站尚未启用SSL安全证书,就难以跟上时代步伐。 但对于企业来说,选购服务器和域名已经足够头疼,更遑论了解SSL安全证书,自行安装可能会遇到一些小…

    2026年4月1日
    0
  • 什么是远程代码执行(RCE)攻击?

    远程代码执行(RCE)攻击指的是借助系统某一层级存在的安全缺陷,向目标系统中植入并运行恶意指令。攻击者借此可在受害系统上执行各类操作——包括下达系统命令、窃取敏感信息、篡改或加密数…

    2026年6月23日
    0
  • 选择共享虚拟主机建站好不好?

    在数字化办公普及的当下,不少企事业单位都将搭建官方网站纳入计划表,在搭建网站时,很多站长采用虚拟主机是觉得虚拟主机使用起来非常方便,但一些站长也觉得虚拟主机的性能不如云服务器。今天…

    2026年5月21日
    0