一句话回答
InfiniBand(简称 IB)是一套专为高性能计算(HPC)和 AI 集群设计的高速、低延迟、无损的网络互联技术。它不像以太网那样"什么都能跑",而是把低延迟、高带宽、CPU 卸载做到了极致,是当前千卡、万卡级 GPU 训练集群的主流网络底座。
IB 是什么:一套完整的专用网络体系
很多人把 IB 理解成"一种更快的网卡",其实不准确。IB 是一套完全独立的网络系统,包含三部分:IB 网卡(也叫 HCA,Host Channel Adapter)、IB 交换机、以及 IB 协议与线缆。它们和以太网在协议层、硬件层、用途上都是两套东西。
打个比方:普通以太网像城市公路,什么车都能走,红绿灯多、会堵车、CPU 要参与调度;InfiniBand 像城际高铁专线,只为"高速数据列车"(多卡 AI 训练、超算并行计算)服务,无红绿灯、几乎不堵车、CPU 几乎不干活。
IB 网卡是插在服务器上、负责接入 IB 网络的硬件设备。相比普通网卡,它最核心的能力是硬件级 RDMA(远程直接内存访问)——数据可以直接从一台服务器的内存传到另一台的内存,绕过操作系统内核,几乎不占用 CPU。
这也是它和"光口万兆网卡"的本质区别:后者只是跑得更快的以太网卡,CPU 开销、协议开销依然在;IB 网卡则从架构上把网络协议处理卸载到了硬件。
IB vs 以太网:关键差异对照
维度 | InfiniBand 网卡 | 普通以太网卡 协议 | InfiniBand 专用协议(IBTA 1.5) | TCP/IP(通用) 端到端延迟 | ~0.5–1 微秒 | ~10 微秒(数十至数百微秒常见) CPU 参与 | 极低(RDMA 绕过内核、零拷贝) | 高(内核拷贝、协议处理) 传输可靠性 | 原生无损(链路级流控) | 有损(高负载可能丢包、抖动) 带宽 | 100G / 200G / 400G(EDR/HDR/NDR) | 1G–100G(新标准可达 400G) 适用场景 | AI 训练、超算、金融高频、高性能存储 | 通用网络、云、办公、家庭
三大核心技术:RDMA、GPUDirect、无损网络
RDMA(远程直接内存访问):允许一台服务器的应用直接读写另一台服务器的内存,绕过操作系统内核和 CPU。对 AI 训练来说,这意味着 GPU 之间的梯度交换不再"经手"CPU,通信开销大幅下降。
GPUDirect RDMA:更进一步,GPU 显存可以直接和 IB 网卡传输数据,完全绕开 CPU 和主机内存拷贝。在分布式训练中,这是把 GPU 利用率从 40–60% 拉到 85–95% 的关键技术之一(据 Mellanox 公开分析,AI 训练场景典型数据)。
无损网络:IB 通过链路级 credit 流控实现原生无损传输——不丢包、低抖动。相比之下,以太网在高负载下依赖拥塞控制"尽力而为",容易在关键训练任务中拖后腿。
IB 速率每一代翻倍,当前主流是三代:
代际 | 单端口速率 | 推出时间 | 典型用途 EDR | 100 Gbps | 2014 | A100 早期集群、存量系统 HDR | 200 Gbps | 2018 | A100/H100 主流 NDR | 400 Gbps | 2022 | H800/H200 与新建智算中心主流
IB 用在哪些场景?
· AI 大模型训练与推理集群:千卡、万卡级 GPU 集群的标配网络 · 超级计算中心:TOP500 中六成以上高性能计算系统采用 IB 架构(2026 年公开统计) · 金融高频交易:端到端延迟需控制在微秒级 · 高性能存储:NVMe-oF 等场景需要低延迟无损网络 · 科研仿真:气象、基因、物理模拟等大规模并行计算
品牌说明
IB 网络产品的主要供应商是 NVIDIA(原 Mellanox,迈络思)。NVIDIA 的 ConnectX 系列智能网卡、Quantum 系列 InfiniBand 交换机,以及 LinkX 系列线缆与光模块,共同构成了当前最完整的 IB 生态。智云时代作为 NVIDIA 认证解决方案服务商,可提供从 ConnectX 网卡、IB 交换机到 LinkX 线缆光模块的一体化选型、采购与部署支持。
延伸阅读
· ConnectX 网卡怎么选?EDR/HDR/NDR 与型号全解读 (#) · AI 训练集群 IB 组网方案:从拓扑设计到部署调优 (#) · IB 网卡采购避坑指南:正品辨别与供应商选择 (#)