什么是AI算力集群?

近些年,AI浪潮席卷全球,成为全社会瞩目的焦点话题。

每当人们谈起人工智能,AI算力集群这个关键词就会频繁出现。AI有三大核心要素,分别是算力、算法与数据,而AI算力集群,恰恰是当前最主要的算力来源。它好比一座超级”能量站”,为高速发展的的AI行业持续输送着动力。

什么是AI算力集群?

AI算力集群,顾名思义,就是能够承载AI计算任务、持续输出算力的集群体系。集群,英文写作cluster,指的是一批彼此独立、借助高速网络相互连通的设备集合。

从行业定义来看,AI算力集群是指”通过高速网络,将海量高性能计算节点(如GPU/TPU服务器)互联起来,进而构成的一种分布式运算体系”。

在AI智算的应用场景中,核心任务无非两类:训练与推理。训练对算力的消耗极为庞大,难度也更高;推理的运算量相对有限,对算力的依赖程度也相应较低。

无论哪类任务,都离不开大规模的矩阵运算(如卷积、张量乘法)。这类计算天然适合拆解为并行子任务分头处理。因此,擅长并行运算的GPU、NPU、TPU等芯片便成为AI计算的核心工具,统称为AI芯片。

AI芯片是产生AI算力的基本单元,但单颗芯片无法独立运作,必须集成到电路板上才能发挥作用。

将AI芯片嵌入手机主板,或直接整合进手机SoC主芯片,便可赋予手机AI运算能力;集成于物联网设备模组中,则能为汽车、机械臂、AGV无人车、摄像头等终端设备提供算力支撑——这些统称为端侧算力。将AI芯片内置于基站、路由器、网关等设备中,则属于边缘侧算力。

上述设备体积紧凑,通常只配置一颗AI芯片,算力有限,主要承担推理类计算任务。

若要完成更为繁重的训练任务,则需要一个可容纳更多AI芯片的硬件平台。

将AI芯片制成算力板卡,再向一台服务器中嵌入多块算力板卡,便造就了AI服务器。本质上,AI服务器是普通服务器叠加多块AI算力板卡的产物。

通常情况下,AI服务器采用”一机八卡”的配置。若强行扩充,部分机型最多可容纳二十块卡,但受散热与功耗的制约,进一步堆叠便难以为继。

此阶段的AI服务器算力已跃升一个量级,驾驭推理任务游刃有余,也能勉强应对一些规模较小的模型训练。

今年崭露头角的DeepSeek大模型,凭借架构与算法层面的深度优化,将算力门槛大幅拉低。由此催生出一类单机架计算设备——集成若干台AI服务器、存储及电源,厂商将其冠名为”一体机”,可满足大量行业用户私有化部署DeepSeek的需求,市场反响相当热烈。

但无论是AI服务器还是一体机,其算力终究有限。面向真正意义上的超大规模参数(千亿级、万亿级)模型训练,仍须构建承载更多AI芯片的系统,也就是真正的大规模AI算力集群。

如今我们常听到”万卡规模””十万卡规模”这样的说法,意指目标集群需要配置一万块乃至十万块AI算力板卡(即AI芯片)。

这该怎么实现?答案归结于两条路径:Scale Up与Scale Out。

什么是Scale Up?

Scale意为扩展,是云计算领域的常见术语。Scale Up,即向上扩展,也称纵向扩展,指的是提升单一节点的资源容量。Scale Out,则是向外扩展,也称横向扩展,指的是增加节点的数量。(云计算中还对应着Scale Down和Scale In,分别代表纵向与横向的缩减。)

前文所说的在单台服务器中增配AI算力板卡,便是Scale Up的典型体现,此时一台服务器即构成一个计算节点。而通过通信网络将多台计算机(节点)串联起来,便是Scale Out。

什么是Scale Up
什么是Scale Up

Scale Up与Scale Out最本质的差异,体现在AI芯片之间的互联带宽上。

Scale Up属于节点内部连接,互联带宽更高、时延更低、性能更强劲。

早期,计算机内部组件间的通信依赖PCIe协议,该协议诞生于上世纪八九十年代PC普及之初,尽管历经多次迭代,但升级节奏迟缓,传输速率与时延均难以契合AI计算的苛刻需求。

为此,英伟达于2014年推出了专有总线协议NVLINK。NVLINK支持GPU之间以点对点方式直连通信,速率远超PCIe,时延也显著更低。

图片来自:英伟达官网
图片来自:英伟达官网

NVLINK最初仅用于机器内部的互联。2022年,英伟达将NVSwitch芯片独立成型,打造成NVLink交换机,用于跨服务器的GPU设备互联。

由此,计算节点不再局限于单台服务器,而是可由多台服务器与网络设备共同构成,处于同一个HBD(High Bandwidth Domain,超带宽域)之内。英伟达将这种以超大带宽实现16卡以上GPU间互联的Scale Up体系,称为超节点。

经过多年迭代,NVLINK已演进至第五代。每块GPU配备18路NVLink连接,Blackwell GPU的总带宽可达1800GB/s,远超PCIe Gen6的总线带宽上限。

2024年3月,英伟达发布NVL72,可将36颗Grace CPU与72颗Blackwell GPU集成于单个液冷机柜之中,实现总计720 Pflops的AI训练性能,或1440 Pflops的推理性能。

英伟达是AI计算领域毋庸置疑的领军者,拥有最受市场认可的AI芯片(GPU)与软件生态(CUDA),也探索出了目前最成熟的Scale Up实现路径。

随着AI赛道持续升温,越来越多的企业相继推出了自研AI芯片。由于NVLINK属于私有协议,这些厂商也需要另辟蹊径,探索构建自有AI算力集群的方案。

英伟达海外的主要竞争对手之一AMD推出了UA LINK;国内的腾讯、阿里、中国移动等企业也牵头推进了ETH-X、ALS、OISA等开放项目。

什么是AI算力集群?

这些均为开放标准,成本比私有协议更具优势,有助于拉低行业门槛,推动技术普惠,也与互联网开放解耦的发展趋势一脉相承。值得关注的是,上述标准大多以以太网技术(ETH)为底座,原因在于以太网技术最为成熟开放,产业链根基深厚。

另一条颇具关注价值的技术路线,是华为的私有协议UB(Unified Bus)。

近年来,华为持续深耕昇腾生态。昇腾是其自研AI芯片,目前已迭代至昇腾910C。华为同样需要与之配套的AI算力集群解决方案,以最大化释放910C的运算潜力,并为市场推广奠定基础。

CloudMatrix384采用了UB技术作为支撑,准确来说包含三个独立网络平面——UB平面、RDMA平面与VPC平面,三者协同互补,大幅提升了卡间通信能力,也整体拉升了超节点的算力输出。受篇幅所限,详细技术细节留待后续专文介绍。

此外值得补充的是,面对开放标准带来的竞争压力,英伟达近期公布了NVLink Fusion计划,向8家合作伙伴开放了NVLink技术,协助其构建基于多芯片互联的定制化AI系统。不过据部分媒体报道,若干关键NVLink组件仍未完全开放,英伟达在这一问题上态度尚显保守。

什么是Scale Out?

Scale Out,实质上更接近我们熟悉的传统数据通信网络范畴。将普通服务器互联所依赖的胖树架构、叶脊网络架构,以及TCP/IP、以太网等基础技术,都构成了Scale Out的底层支撑。

当然,AI智算对网络性能的要求远比传统应用苛刻,传统技术也必须升级,方能达到门槛。

目前,Scale Out领域主流采用的通信网络技术是Infiniband(IB)与RoCEv2,两者均基于RDMA(远程直接内存访问)协议,相比传统以太网在速率、时延和负载均衡等维度均有显著提升。

IB当年的初衷也是替代PCIe,后来几经沉浮,掌握这一技术的Mellanox(迈络思)被英伟达并购,IB随之成为英伟达的私有技术。该技术性能卓越,但价格同样不菲,是英伟达算力版图的重要组成部分。

RoCEv2则是开放标准,是传统以太网融合RDMA的衍生产物,也是业界抗衡IB一家独大而推出的替代方案,价格更为亲民,与IB的性能差距也在持续收窄。

与Scale Up领域多标准并存的局面不同,Scale Out目前的标准相对集中,主流方向基本锁定为RoCEv2,路线清晰明朗。这也不难理解——Scale Up属于节点内部互联,与芯片产品高度绑定;Scale Out属于节点间互联,更侧重通用兼容性。

从带宽数值来看,IB与RoCEv2目前仅能提供Tbps量级的带宽;而Scale Up可在数百颗GPU之间实现10Tbps量级的互联速率,差距相当悬殊。在时延方面,两者同样分野明显:IB与RoCEv2的时延在10微秒左右,而Scale Up对网络时延的要求极为严苛,须达到百纳秒(即0.1微秒)级别。

在AI训练过程中,通常并行运用多种并行计算策略,包括TP(张量并行)、EP(专家并行)、PP(流水线并行)以及DP(数据并行)。一般而言,PP与DP的通信量相对可控,通常交由Scale Out承接;TP与EP的通信量庞大,则需要依托Scale Up(超节点内部)来完成。

什么是AI算力集群?

超节点作为Scale Up当前最优的落地形态,借助内部高速总线互联,能够有效支撑并行计算任务,加快GPU之间的参数交换与数据同步,从而显著压缩大模型的训练周期。

超节点通常还具备内存语义能力,GPU之间可直接访问对方的内存空间,这也是Scale Out所不具备的。

从组网与运维的视角来看,更大规模的Scale Up同样具备明显优势——超节点的HBD越大、Scale Up侧的GPU数量越多,Scale Out的组网就越趋于简化,可大幅降低网络部署的复杂度与周期,后期运维也更为便捷。

什么是AI算力集群?

当然,Scale Up并非可以无限扩张,成本因素同样是不可忽视的边界条件,具体规模须结合应用场景进行测算。

概括而言,Scale Up与Scale Out,本质上是性能与成本之间的动态平衡。随着时间推移与技术演进,更大规模的超节点将陆续涌现,Scale Up与Scale Out之间的边界也将日渐模糊。

前文提及的ETH-X等开放Scale Up标准均以以太网技术为底座,从技术可行性来看,以太网已具备最大交换芯片容量(单芯片51.2T已实现商用)、最高速Serdes技术(目前达到112Gbps),交换芯片时延也低至200ns,完全能够满足Scale Up的性能诉求。而Scale Out同样基于以太网,二者有望殊途同归,走向大一统。

AI算力集群的发展趋势

最后,梳理一下AI算力集群当前几个值得关注的趋势动向。

一是物理空间的异地分布化。 AI算力集群正向万卡、十万卡规模迈进。英伟达NVL72单个机架容纳72颗芯片,华为CM384以16个机架集成384颗芯片。若华为基于CM384构建十万卡集群,需要432套(384×432≈165888颗),对应约6912个机架。单体数据中心难以容纳如此体量,电力供给同样面临瓶颈。因此,业界正在积极探索多地数据中心协同组成AI算力集群、合力完成训练任务的模式,这对长距离、大带宽、低时延的DCI光通信技术提出了更高要求,也将进一步加速空芯光纤等前沿技术的规模化落地。

二是节点架构的深度定制化。 以往讨论AI集群,焦点往往集中在如何堆叠更多芯片。而今,架构层面的精细设计愈发受到重视——计算资源(GPU、NPU、CPU,乃至内存、存储)的池化趋势日益显著,集群需要深度适配AI大模型的架构特征(如MoE架构),提供量身定制的设计方案,方能充分发挥算力潜能。换言之,单纯提供AI芯片已不再足够,还需要给出贴合需求的整体解决方案。

三是运维管理的智能化。 AI大模型训练过程中容易出现故障,严重时数小时便可能中断一次,一旦出错就需要从头重算,不仅拉长训练周期,也大幅抬升训练成本。为此,企业在构建AI算力集群时,越来越重视系统的稳定性与可靠性,借助AI技术提前研判潜在故障、主动替换亚健康设备或模块,正在成为主流做法。这类举措有助于压低故障率与中断率,在提升系统稳定性的同时,也间接放大了有效算力产出。

四是算力供给的绿色低碳化。 AI智算对算力的消耗庞大,随之而来的能耗问题同样不容忽视。目前,各大厂商都在积极探索降低AI算力集群能耗的方法,持续提升绿色能源的使用比例,这对于AI智算的可持续发展至关重要。我国推进的”东数西算”战略,也有着同样的政策考量与目标导向。

以上便是关于AI算力集群的系统性梳理,涵盖了从基本概念、核心架构到技术路线与发展趋势的主要内容。

原创文章,作者:余初云,如若转载,请注明出处:https://blog.jidcy.com/jsjc/3049.html

Like (0)
Previous 2026年6月29日 上午9:17
Next 2026年6月29日

相关推荐

  • WordPress报413请求实体过大错误

    413 请求实体过大错误,是一种 HTTP 响应,意思是你发送的内容比服务器能接受的要大。HTTP 400 系列错误一般是客户端的问题,但 413 错误更多是因为上传的内容本身合法…

    2026年3月28日
    0
  • CC攻击的原理及表现

    CC攻击又可以被称为Challenge Collapsar攻击,是一种十分常见的分布式拒绝服务攻击方式,CC攻击的工作原理是在与攻击者通过控制一系列主机,不间断的向目标服务器发送大…

    2026年6月24日
    0
  • 网站采用CDN加速的好处

    在数字内容高速增长、用户对网络体验要求不断提升的背景下,CDN 内容分发网络通过就近缓存与智能调度,为网站加速、视频点播、文件分发等场景提供高效稳定的内容传输能力。CDN(内容分发…

    2026年6月16日
    0
  • 高防ip是什么?

    高防 IP 属于一项付费增值服务,主要用于解决互联网服务器遭遇大流量 DDoS 攻击后服务中断的问题。用户配置该 IP 后,可把攻击流量导向高防节点,保障源服务器平稳运行。该服务无…

    2026年5月27日
    0
  • DDoS分布式拒绝服务攻击种类

    网络新闻中总能频繁看到各类大型平台遭遇DDoS攻击的相关报道,这类攻击会直接造成网站宕机、页面瘫痪,用户无法正常浏览和使用平台内容。当下网络环境中,主流的DDoS攻击方式主要有以下…

    2026年5月27日
    0
  • 一文读懂 WebP 图像格式是什么?

    许多网站开始采用一种名为 WebP 的新图像格式。它究竟是什么,又为何比其他格式更有优势? WebP 是谷歌收购 On2 Technologies 后开发的图像格式,基于 VP8 …

    2026年4月11日
    0
  • 什么是内网渗透?内网渗透工具有哪些?

    内网穿透也叫NAT穿越,核心是在部署了NAT设备的私有TCP/IP网络里,让不同内网主机之间成功建立连接,通过端口映射的方式,让公网设备能够定位到处于内网环境的主机。 而内网渗透指…

    2026年6月30日
    0
  • 域名赎回期究竟指的是什么?

    大家会发现,未及时续费的域名,过期一段时间后会进入赎回期,续费的价格会比正常续费贵上十几倍。所谓域名赎回,是指域名因未在常规续费期限内完成续费,被移入国际域名总库,国际域名总库会对…

    2026年6月15日
    0
  • 如何在 Arch Linux 系统上保障 SSH 服务器的安全性

    OpenSSH 是一种安全的远程登录协议,能够在不安全的网络上建立安全通道。它使系统管理员能够通过安全通道远程管理 Linux 服务器。它采用客户端-服务器架构,并允许用户远程连接…

    2026年4月3日
    0
  • 如何在 Linux 服务器上使用 Dokploy 实现项目快速部署

    很多开发者写完应用后都会面临同一个问题:如何把本地代码稳定地上线到服务器。配置 Web 服务器、环境变量、SSL 证书、Docker、CI/CD 等一系列操作,对新手来说既繁琐又容…

    2026年4月21日
    0