OpenAI携手AMD、博通、英特尔、微软、英伟达发布MRC协议,提升大规模AI训练网络韧性

2026-05-07 17:14:15   |   微观猎人   |   959

5月7日,OpenAI于昨日(5月6日)发布公告,宣布携手AMD、博通、英特尔、微软和英伟达,共同推出多路径可靠连接协议,并通过开放计算项目(OCP)向全行业开放。该协议旨在解决大规模AI训练中面临的网络延迟和故障问题。

据介绍,MRC全称为Multipath Reliable Connection,基于RoCE标准扩展,并结合SRv6技术。它通过OCP向全行业开源,致力于提升超级计算机网络的性能与韧性。大规模AI训练模型时,单一数据传输的延迟可能导致整个进程中断,造成GPU闲置,而网络拥塞、链路及设备故障是主要诱因,集群规模越大,问题发生频率越高。

针对传统网络架构扩展性不足的问题,MRC采用多平面网络设计。它将单一800Gb/s接口拆分为多个较小链路,仅需两层交换机即可连接约13.1万块GPU。相比传统三层或四层架构,这一设计显著降低了网络功耗与组件数量,既降低了成本,又提升了路径多样性。

在流量调度方面,MRC引入了自适应数据包喷淋技术。与传统单路径传输不同,该技术将单一传输任务的数据包分散至数百条路径并行传输,有效避免核心网络拥塞。即使数据包乱序到达,接收端也能依据内存地址信息正确重组。

为了简化网络控制,MRC摒弃了复杂的动态路由协议(如BGP),转而采用SRv6源路由。发送端直接指定数据包路径,交换机仅需依据静态配置表转发。这种机制消除了动态路由的故障行为,使网络故障恢复时间从秒级缩短至微秒级。

实际部署数据显示,MRC已应用于NVIDIA GB200超级计算机及Oracle Cloud Infrastructure站点。在真实训练场景中,即使发生链路抖动或交换机重启,MRC也能在不中断训练任务的情况下自动绕过故障。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

OpenAI携手AMD、博通、英特尔、微软、英伟达发布MRC协议,提升大规模AI训练网络韧性

2026-05-07 17:14:15 浏览量: 959 作者: 微观猎人

5月7日,OpenAI于昨日(5月6日)发布公告,宣布携手AMD、博通、英特尔、微软和英伟达,共同推出多路径可靠连接协议,并通过开放计算项目(OCP)向全行业开放。该协议旨在解决大规模AI训练中面临的网络延迟和故障问题。

据介绍,MRC全称为Multipath Reliable Connection,基于RoCE标准扩展,并结合SRv6技术。它通过OCP向全行业开源,致力于提升超级计算机网络的性能与韧性。大规模AI训练模型时,单一数据传输的延迟可能导致整个进程中断,造成GPU闲置,而网络拥塞、链路及设备故障是主要诱因,集群规模越大,问题发生频率越高。

针对传统网络架构扩展性不足的问题,MRC采用多平面网络设计。它将单一800Gb/s接口拆分为多个较小链路,仅需两层交换机即可连接约13.1万块GPU。相比传统三层或四层架构,这一设计显著降低了网络功耗与组件数量,既降低了成本,又提升了路径多样性。

在流量调度方面,MRC引入了自适应数据包喷淋技术。与传统单路径传输不同,该技术将单一传输任务的数据包分散至数百条路径并行传输,有效避免核心网络拥塞。即使数据包乱序到达,接收端也能依据内存地址信息正确重组。

为了简化网络控制,MRC摒弃了复杂的动态路由协议(如BGP),转而采用SRv6源路由。发送端直接指定数据包路径,交换机仅需依据静态配置表转发。这种机制消除了动态路由的故障行为,使网络故障恢复时间从秒级缩短至微秒级。

实际部署数据显示,MRC已应用于NVIDIA GB200超级计算机及Oracle Cloud Infrastructure站点。在真实训练场景中,即使发生链路抖动或交换机重启,MRC也能在不中断训练任务的情况下自动绕过故障。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号