
聊到AI互联技术先讲个真事。去年我帮一个朋友调他的小集群4张A100 40G驱动、CUDA、NCCL全装好了跑大模型训练就是慢得离谱。查了半天发现问题出在互联他买的是早期PCIe版A100没有NVLink跨卡通信全靠PCIe总线训练吞吐比同配SXM版本直接掉了一大截。这个经历让我意识到GPU算力再强“喂不饱”就是白搭。今天这篇就把NVLink、InfiniBand、UALink、Ultra Ethernet这四个词彻底讲透最后再聊聊最近圈子里问得最多的实际问题——SGLang在无NVLink的机器上跑影响到底有多大。先给没接触过的人打个底这四个词代表了当前AI计算集群里最核心的两条技术路线。NVLink和UALink管“机箱内部/机架内部怎么把GPU黏成一块”属于scale-upInfiniBand和Ultra Ethernet管“机器之间怎么组网”属于scale-out。搞不清这两条赛道看再多新闻也是浆糊。下面我按自己的理解从底层机制一路讲到选型和实战踩坑。1. AI算力时代为什么互联技术突然成了主角1.1 算力翻倍了互联到底卡了什么过去十年GPU的单卡算力涨了不止一个数量级但很多人没意识到单卡算力再强也装不下现在的大模型。以DeepSeek-R1这种671B参数的MoE模型为例光权重就要1.2TB以上的显存一块80GB的H100连零头都放不下。模型必须切到多张卡上切完之后每算一层都要跨卡同步结果。这里的核心矛盾叫“通信占比”。我打个比方把一个团队的活儿分给10个人干如果每干一步都要互相碰头对进度那碰头本身消耗的时间可能比干活还多。大模型训练和推理就是这么个状态。Transformer的每一层前向计算都伴随着AllReduce或者All-to-All通信层数越多、序列越长、batch越大通信量涨得越狠。GPU算力提升的速度远远快于总线带宽和网络带宽的提升速度于是“互联”反而成了决定集群实际效率的天花板。这也是为什么NVLink、InfiniBand这些名词会从机房工程师的小圈子一路火到普通开发者的讨论列表里。它们不再只是“网络设备选型”问题而是直接决定你的显卡能不能吃饱、模型能跑多大、吞吐能飙多高的生死线。1.2 四大技术一次认清这四种技术天天有人提但很多人一直没建立起整体框架。先用最短的话说清楚NVLinkNVIDIA自家的私有高速互联主要用来做GPU到GPU、GPU到CPUGrace Hopper那种的直连。带宽高、延迟低但只服务N卡闭源。InfiniBand从HPC超算时代活到今天的网络技术。Mellanox被NVIDIA收购之后成了NVIDIA集群的官方scale-out网络RDMA、无损传输是它的招牌。UALinkAMD、博通、谷歌、Intel、Meta等厂商联手推的开放加速器互联标准目标就是对标NVLink让不同厂商的加速器能像N卡一样高速互联。Ultra Ethernet同样是一个开放联盟的产物博通、思科、AMD、Intel、微软等主导基于以太网技术做超低延迟、超高带宽的AI网络目标就是对标InfiniBand。记住一个关键点NVLink和UALink是“近亲对手”InfiniBand和Ultra Ethernet是“远亲对手”。前者管的是把GPU“粘”在一起后者管的是把“粘好的簇”连成大规模集群。1.3 Scale-up和Scale-out看懂这个就通了一半我见过太多人把NVLink和InfiniBand混为一谈其实就是没分清这两层。Scale-up纵向扩展解决的是“单节点内怎么把GPU拼成一块大GPU”的问题。比如DGX服务器里8卡全互联GPU之间可以直接读写对方显存对软件呈现出来的效果近似于一块容量超大、带宽超高的虚拟GPU。NVLink、NVSwitch、UALink都是这一层。Scale-out横向扩展解决的是“节点之间怎么组集群”的问题。大模型单机放不下、单机算力不够就必须把几百上千台机器连成一张网。InfiniBand、Ultra Ethernet以及被广泛吐槽的RDMA over Ethernet都属于这一层。实际的大模型集群通常两个都占单机或单机架内部尽量用scale-up把卡粘紧机架之间再用scale-out网络打通。NVIDIA的高端方案是“NVLink做scale-up InfiniBand做scale-out”后来也提供Spectrum-X以太网做scale-out开放阵营正在推“UALink做scale-up Ultra Ethernet做scale-out”的组合拳。搞懂了这条线下面所有技术细节都不难理解。2. NVLinkNVIDIA的后花园为何让对手头疼2.1 从P100到GB200每一代到底进步了多少NVLink到今天已经迭代了五代每一代的带宽都在翻倍。我列个自己经常拿来参考的对照表世代代表GPU每GPU双向聚合带宽相对PCIe的优势NVLink 1.0P100160 GB/s约PCIe 3.0 x16的5倍NVLink 2.0V100300 GB/s约PCIe 3.0 x16的9倍NVLink 3.0A100600 GB/s约PCIe 4.0 x16的10倍NVLink 4.0H100900 GB/s约PCIe 5.0 x16的14倍NVLink 5.0B200/GB2001.8 TB/s数倍于PCIe 6.0 x16解读这张表之前先提醒一句工程上别把GB/s和Gb/s搞混。NVLink的带宽官方习惯用字节单位GB/sInfiniBand则常用比特单位Gb/s两者差了8倍很多人明明看对了数字换算时还是翻车。NVLink每一代翻倍靠的是两件事一是单条链路的速率提升二是每张GPU上物理链路条数变多。H100做到了18条链路、每条约50 GB/s拼出900 GB/s的双向带宽。这个数字意味着什么一个H100的显存带宽大约是3.35 TB/sNVLink 900 GB/s大约是显存带宽的27%。跨卡读数据的时候虽然比读本地显存慢但已经比走PCIe快一个数量级很多并行算法只有在这样的带宽下才转得动。2.2 NVSwitch与NVLink域从8卡到576卡背后的工程如果你有8张GPU想让任意两张卡之间都有高速直连最简单的想法是两两连线但这样每张卡要拉出去7根线缆卡上物理空间根本不够拓扑也变得复杂。NVIDIA的解决方案是在中间放一个交换机这就是NVSwitch。第一代NVSwitch出现在Volta时代把8卡全互联变成“每张卡都连到交换机上”。到了Hopper架构NVSwitch已经把NVLink域撑到了256张GPU全互联Blackwell的GB200 NVL72更夸张两个机架内72张GPU通过NVLink组成一个域任意两张卡之间都能以高带宽低延迟互访。这才是NVLink最“恐怖”的地方它不只是点对点高速直连而是把一整个机柜变成了一台“超级GPU”。你在上面跑张量并行Tensor Parallelism通信延迟能压在微秒级通信带宽接近显存级。这种体验其他生态到现在都没有对等物。UALink想做的正是这件事但工程难度远超想象——NVSwitch里有复杂的路由、流控、内存一致性和故障隔离逻辑这些都不是一纸规范能解决的。2.3 优势与隐藏成本NVLink的优势总结起来就三句话快、稳、省心。快是带宽和延迟碾压一切现有替代方案稳是NCCL通信库和NVIDIA的硬件深度绑定开箱即用生态成熟到让人无脑省心是NVLink域内开发者几乎不需要考虑网络拓扑把GPU当一块大显存用就行。但代价也很现实。第一只有NVIDIA的专业卡才带NVLink消费级的4090、5090早就被砍掉了第二PCIe版的A100/H100是没有NVLink的想用得多花钱买SXM版和配套的NVSwitch整机第三整套方案是封闭的价格由NVIDIA说了算。很多云厂商和自研芯片团队正是被这种“绑定感”逼得去搞开放生态——这也就是UALink和Ultra Ethernet出现的直接动机。3. InfiniBandHPC老兵如何在AI时代站上C位3.1 从HPC机房到AI集群的逆袭InfiniBand不是新技术1999年就由InfiniBand Trade Association提出了早期在超算领域混得风生水起Top500超算里一半以上的互联走的是它。后来因为价格贵、生态复杂在通用数据中心里始终没干过以太网。结果AI时代一来事情反过来了大模型训练对网络的带宽、延迟、可靠性要求都极其苛刻传统以太网那套“尽力而为”的模型撑不住InfiniBand当年的老本行——RDMA和无损传输——反而成了刚需。Mellanox被NVIDIA收购之后InfiniBand更是直接绑进了NVIDIA的AI全家桶。前面说NVLink解决机内scale-up那机间scale-out呢NVIDIA的答案就是InfiniBand或自家Spectrum以太网。你去看现在的大规模GPU集群不管是DGX SuperPOD还是云厂商的H100集群机间网络里InfiniBand占了相当大的比例。3.2 RDMA、无损网络和子网管理器三大核心机制InfiniBand的强大之处可以浓缩成三个词。RDMARemote Direct Memory Access远程直接内存访问。传统网络通信要经过“用户态→内核→网卡→网络→对端内核→对端用户态”这条漫漫长路CPU参与大量数据拷贝。RDMA让网卡直接读写对端内存CPU基本不介入延迟和CPU开销都大幅下降。这在大规模集合通信比如AllReduce里价值巨大因为每个GPU都要频繁和其他GPU交换数据CPU要是每次都被打断性能直接崩掉。无损网络。以太网靠丢包重传保证可靠传输丢一个包重传一次延迟波动很大。InfiniBand的设计思路完全不同它靠基于信用的流控从交换机端口到网卡逐跳做流控物理上做到“不丢包”。对于同步式并行训练任何一个包的延迟抖动都会被放大成整个集群的等待无损特性在这时候就是生命线。子网管理器Subnet Manager。以太网是平层广播式谁都能发、谁都能收InfiniBand则有一个集中的子网管理器负责计算路由、配置队列对和地址解析。等于网络里有一个“交警队”提前规划好每条数据的路线而不是大家乱走这换来了更低的转发延迟和更可控的拥塞行为。3.3 带宽演进EDR/HDR/NDR速率换算表InfiniBand的口径是Gb/s而且一个接口通常是4条物理通道4x聚合。我做表时喜欢顺手换成GB/s避免自己都看懵代际单端口速率换算成字节常见网卡型号EDR100 Gb/s12.5 GB/sConnectX-5HDR200 Gb/s25 GB/sConnectX-6NDR400 Gb/s50 GB/sConnectX-7XDR800 Gb/s100 GB/sConnectX-8 / Quantum-X800很多人问为什么AI集群里“每GPU一张400G网卡”成了标配算一笔账就明白一张H100的NVLink带宽是900 GB/s但那是机内scale-up跨机通信只有一条400 Gb/s网卡也就是50 GB/s和NVLink差了18倍。如果模型并行里跨机通信占比高整机效率会很难看所以集群设计要尽量把通信留在节点内。这也是为什么现在“机内尽量多塞GPU”成了趋势——把更多GPU放进一个NVLink域跨机通信占比自然就小了。4. UALink与Ultra Ethernet开放联盟吹响反击号角4.1 UALink瞄准NVLink的开放标准UALink全称Ultra Accelerator Link发起阵容相当豪华AMD、博通、思科、谷歌、慧与HPE、Intel、Meta、微软都是核心成员。说白了这些厂商有一个共同的“敌人”——NVIDIA在GPU互联上的绝对垄断。UALink的目的是定义一套开放的高速、低延迟加速器互联规范让不同厂商的GPU/AI加速器能像N卡用NVLink那样高效互通。技术上它借鉴了PCIe和CXL的生态走的是对等直连交换机的路线。按公开路线图UALink 1.x会从64个加速器的小规模域起步后续扩展到1024个加速器的规模带宽目标同样瞄着数百GB/s到TB/s级别。但开放标准从纸面到落地路还很长。UALink遇到了两个现实问题一是NVIDIA不参与意味着最大玩家直接缺席生态推进全靠AMD等厂商的自研加速器撑场二是NVSwitch那套东西NVIDIA打磨了十多年UALink相关交换芯片和网卡还在早期阶段。2024年才正式发布1.0规范到真正能在数据中心里批量部署我估计还得两三年。方向是对的但短期内别指望它能动摇NVLink。4.2 Ultra Ethernet给以太网装上“AI专用引擎”Ultra Ethernet是另一条战线它要抢的是InfiniBand的地盘发起成员包括博通、思科、AMD、Intel、微软、Meta几乎把网络和云的大厂一网打尽。传统以太网为什么在AI场景里被InfiniBand压着打两点丢包重传导致延迟不稳定哈希负载不均导致路径利用率低。Ultra Ethernet的思路不是推翻以太网而是给以太网做AI时代的增强几个核心创新值得一说。包喷洒Packet Spray。传统以太网靠五元组哈希把一条流固定到一条路径上流大了容易“一条路堵死、旁边路空着”。包喷洒则把流量拆散到所有可用路径上并行传输天然解决了负载不均。这就像高速公路上不再按车辆目的地分车道而是让所有车都用满所有车道。增强拥塞控制。AI训练的特点是周期性的“脉冲”流量——AllReduce一来全网瞬时间灌满数据。传统拥塞控制在慢启动和降速上过于保守收效太慢。Ultra Ethernet在端到端拥塞控制上做了大量优化目标是让网络在突发流量下也能保持低延迟高吞吐。面向集合通信的优化。它会把AllReduce这类常见通信模式映射到网络层的多路径传输里等于让交换机“认识”并行计算的通信特征从协议层帮助GPU集群更高效地完成跨机同步。Ultra Ethernet同样在2024年发布了1.0规范眼下最大的优势是“生态顺势”现有以太网设备、光模块、运维经验都能平滑升级而InfiniBand的封闭和价格给了它足够的市场空间去追赶。4.3 开放生态与专有生态一张表看懂格局维度NVIDIA专有生态开放联盟生态代表技术NVLink InfiniBand / SpectrumUALink Ultra Ethernet主导厂商NVIDIAAMD、Intel、博通、Meta、微软等优势性能最强、生态成熟、开箱即用多厂商、开放标准、成本潜力大劣势封闭、贵、绑定N卡早期阶段、性能待验证、生态碎片化落地时间当下就是主力预计2-3年后开始规模部署如果你是个人开发者或者中小团队今天能买到的开放生态产品还很有限如果你在大厂做算力规划和自研芯片互联开放标准的动向已经必须纳入考虑。两条路线未来大概率会并存而不是谁立刻干掉谁。5. 终极对决四者对比与场景选型5.1 关键参数横向对比放一张我自己整理的速查表注意单位已经统一技术定位带宽量级典型规模主要优势主要缺点NVLinkscale-upH100 900GB/sGB200 1.8TB/s单域可达数百GPU极致带宽和延迟生态最成熟专有仅N卡成本高UALinkscale-up目标数百GB/s至TB/s级目标64→1024加速器开放多厂商标准早期硬件尚未规模落地InfiniBandscale-out单口400/800Gb/s数千节点低延迟、无损、专用性强封闭昂贵运维门槛高Ultra Ethernetscale-out400G/800G/1.6T以太网超大规模成本低、生态广、部署平滑大规模AI性能仍需验证5.2 现实中的集群拓扑谁在什么时候管什么理解了这张表再看一个真实集群的拓扑就简单了。以NVIDIA DGX H100 SuperPOD为例每一台DGX H100服务器内有8张H100用NVLinkNVSwitch组成900GB/s的机内互联每张卡外接一张400G InfiniBand网卡机架内通过交换机汇聚再向上连到核心交换机最终把上百台机器连成一张无损网络。这个架构里有个设计哲学值得学习通信是有“局部性”的。尽量让高频通信发生在NVLink域内同机把低频率的跨机通信交给InfiniBand。软件层NCCL会自动感知拓扑帮你在不同的通信路径上做选择。开放生态未来如果成熟拓扑结构类似只是把NVLink换成UALink、把InfiniBand换成Ultra Ethernet。5.3 不同规模玩家的选型建议预算充足且追求极致性能无脑选NVIDIA全家桶。机内NVLink机间上InfiniBand软件生态最省心性能也最能打。预算有限但已有N卡机内能上NVLink就上跨机通信走RoCERDMA over Converged Ethernet以太网。虽然比InfiniBand弱一些但以太网便宜且灵活很多中小集群的实际选择。希望摆脱NVIDIA绑定关注AMD MI系列加速器 UALink Ultra Ethernet的组合适合科研机构、自研芯片团队和想要长期自主可控的云厂商。个人开发者/小规模推理其实用不上InfiniBand和NVLink那一套PCIe P2P和普通万兆/25G网络足够。重点是把并行策略选对别盲目开大TP具体见下一节。6. 热点实战SGLang在无NVLink机器上影响多大6.1 SGLang是什么为什么都在用SGLang是目前LLM推理部署圈子里热度极高的引擎核心能力包括RadixAttention自动KV Cache复用、高效连续批处理、对DeepSeek V3/R1类MoE模型的深度优化。简单说同样一张卡用SGLang往往能在吞吐和显存效率上比老牌框架更胜一筹。但它是个“吃并行”的框架模型并行TP、专家并行EP、数据并行DP全都支持也都可以组合。并行是好事可一旦涉及并行互联带宽就成了胜负手。问题来了如果手头机器没有NVLinkSGLang到底能跑成什么样6.2 无NVLink时TP/EP/DP三种并行模式分别怎样要回答这个问题得先把三种并行模式的通信底细说清楚。张量并行TP是把一个算子的矩阵切成多份多卡各算一部分再互相合并。这种模式通信频率极高几乎每层每步都做AllReduce对带宽和延迟都极其敏感。没有NVLinkTP2的通信走PCIe都算吃力TP8直接是自己卡自己。专家并行EP是MoE模型常用的策略不同的专家分配到不同GPU每个token都要把中间结果发给所有专家卡再把专家结果收回来也就是All-to-All通信。EP的通信量比TP温和一些也是SGLang跑DeepSeek这类MoE模型的关键。数据并行DP最简单每张卡放一份完整模型各处理各的请求卡间几乎不通信只做最终汇总。没有NVLink时DP是最舒服的模式代价是单张卡必须放得下整个模型。如果机器没有NVLink能走的就是PCIe或者千兆万兆网络。以一个真实常见组合为例两张RTX 4090PCIe 4.0 x16单方向约32GB/s双向约64GB/s。对比一张H100的NVLink 900GB/s差了一个数量级以上。所以核心结论就是TP在无NVLink环境下极其昂贵尽量不用或只用TP2EP能跑但All-to-All通信的耗时会被放大batch越大、序列越长越明显DP受影响最小是“无NVLink跑SGLang”最优先考虑的模式。6.3 实测感知以两张无NVLink卡跑大模型为例我用一个简化模型来估算EP的通信账单假设hidden size是7168DeepSeek V3级别bf16是2字节那么每个token的中间向量约14KB。一个小batch里1024个tokensingle层的All-to-All通信量大约是2×1024×14KB≈28MB。DeepSeek有几十层MoE层全算下来一小批请求就得搬几个GB的数据。在NVLink域内这问题不大但在32GB/s的PCIe通道上每多一层多一秒整个decode过程会被通信拖到“能用但很憋屈”的程度。实际感受上我见过有人在无NVLink的双卡机器上硬开TP2跑70B模型单请求延迟还算能看但并发稍微一上来响应时间直线上升而把模式切成DP之后同样的并发吞吐反而翻倍还多。原因就是TP把单请求分散到了两张卡上反复通信而DP让两张卡各自独立干活等于你说好了一起搬砖结果改成各干各的没有了沟通成本效率自然高。6.4 无NVLink场景的优化清单如果你手里的机器就是没有NVLink下面这套组合拳值得照抄先用nvidia-smi topo -m看卡间拓扑确认P2P是否可用、走的是不是PCIe直连。模型能塞进单卡优先--tp 1 --dp N这是最稳的用法。如果是MoE大模型必须EP尽量让EP的规模跨卡时通信走PCIe但把TP压到最小例如--tp 1 --dp 2配合SGLang的EP调度。长上下文场景下显存不够时别急着开TP优先考虑KV Cache量化或请求级显存管理能不跨卡就不跨卡。训练/推理框架不要开满默认并行度先用小batch实测通信占比找到“通信量小、利用率高”的甜点。说句实在话无NVLink的机器跑SGLang性能损失通常在数倍甚至一个数量级但远没到“完全不能用”的地步。关键是把并行模式从“以TP为中心”切换到“以DP为中心”接受通信受限的现实。7. 常见问题与排查技巧实录7.1 常见问题速查表现象可能原因定位方式建议处理开TP后吞吐骤降GPU间无NVLink或PCIe带宽不足nvidia-smi topo -m改为TP1DP日志里频繁出现NCCL WARNNCCL感知到拓扑不支持P2P查看NCCL_DEBUG输出检查环境变量和拓扑必要时降级多卡显存占用不均衡EP路由不均衡观察SGLang指标调整DP/EP组合增大batch跨机训练网络延迟抖动大以太网丢包重传跑ping和ib_write_bw对比有预算上IB或无损RoCE7.2 排查命令与定位流程第一步永远是看拓扑命令是nvidia-smi topo -m。输出里NV#号说明有NVLink直连否则PV、CPU等字段代表走PCIe或处理器。看到目标GPU之间没有NVLink心里就该有数通信快不了。第二步看实际带宽而不是理论参数。可以用NCCL官方的allreduce测试程序分别测同机、跨机、有/无NVLink的带宽能测出PCIe实载数据率。跑一跑你就知道“32GB/s理论值”实际只有七八成再被交换机一搅和可能连一半都到不了。第三步检查SGLang日志。SGLang起来时会打印并行配置和NCCL初始化信息看到异常直接搜NCCL文档。如果跑训练还可以挂nsys profile看通信时间占比数值高于30%就该调整并行策略了。7.3 我的几条独家避坑心得第一买卡之前一定确认清楚“带不带NVLink”。A100和H100都有PCIe版和SXM版之分SXM版通常带NVLinkPCIe版不带。很多二手渠道卖便宜卡标注都含糊买回来跑大模型才发现卡脖子欲哭无泪。第二不要迷信“越多并行越快”。并行度不是越高越好通信占比一旦上来卡越多反而越慢。有些模型在小机器上甚至不如单卡offload跑得快。做任何并行设置之前先算通信账这是所有方案选型的底层逻辑。第三InfiniBand的部署和维护门槛比以太网高很多。固件升级、子网管理器配置、路由策略每一个都是暗坑。如果你不是几十卡以上的规模直接上IB大概率是给自己找罪受扎实的RoCE方案反而更实际。第四如果非要在无NVLink机器上跑SGLang我的最大心得就一条放弃TP执念。TP1、DP开满用吞吐换显存用调度换延迟这才能把每张卡的价值榨干。聊到这儿我对“AI互联技术”这件事的整体判断是这样的NVIDIA的NVLink和InfiniBand今天依然是性能天花板但开放生态的UALink和Ultra Ethernet已经把方向定下来了未来两三年大概率会出现真正的规模落地。对你个人而言别被各种参数宣传带偏先搞清楚自己是scale-up受限还是scale-out受限是通信占比高还是显存放不下再决定该把钱花在哪一环节。如果你手里正好只有两张没有NVLink的卡我的建议是先用DP跑起来把真实业务先撑住。等哪天预算到位、要上大规模集群了再回头按本文这套框架去选型你会少走很多弯路。