由 OpenAI 牵头,联合 AMD、博通、英特尔、微软和英伟达等科技巨头组成的联盟,近日发布了一种全新网络协议,旨在解决长期存在、并因 AI 大规模数据处理需求而日益加剧的网络拥塞问题。
这一新协议名为"多路径可靠连接"(Multipath Reliable Connection,简称 MRC),专为在超过 10 万块 GPU 的集群上训练模型而设计。其核心思路是将网络流量同时分发至数百条网络路径,而非像传统方式那样将流量集中在少数几条容易发生拥塞的链路上。
OpenAI 在宣布该项目的博客文章中写道:"网络拥塞、链路故障和设备故障是传输过程中造成延迟和抖动的最常见根源。随着集群规模的扩大,这些问题出现的频率也越来越高,处理起来也越来越困难。"
OpenAI 进一步指出,哪怕是单次故障,也可能导致训练任务崩溃,迫使系统从上一个保存的检查点重新启动,或在网络重新计算路由的过程中停滞数秒之久。这类中断不仅耗费大量 GPU 算力,也造成了严重的时间损失。
"我们运行的任务规模越大,任何一次链路抖动或故障所带来的影响就越大。这类工作负载本质上是一种'故障放大器',因此防止此类问题的发生已变得至关重要。"该公司表示。
MRC 协议由 OpenAI 主导开发,AMD、博通、英特尔、微软和英伟达均作出了重要技术贡献,整个项目由开放计算平台(OCP)联盟负责托管与协调。
英伟达在 MRC 中引入了其 Spectrum-X 以太网技术。英伟达表示,目前 MRC 已在全球部分最大规模的 AI 训练集群中投入生产使用,其中包括 OpenAI,用于训练 ChatGPT 和 Codex 等前沿大语言模型。
Spectrum-X 技术同样被应用于微软的 Fairwater 数据中心,以及甲骨文云基础设施(OCI)位于 Abilene 的数据中心(该数据中心隶属于"星际之门"项目),这两处均是专为训练和部署前沿大语言模型而打造的超大规模 AI 工厂。
MRC 通过在所有可用路径上进行负载均衡,并实时动态规避过载路径,从而实现最优的 GPU 利用率。据 OpenAI 介绍,传统网络结构在发生故障后,往往需要数秒乃至数十秒才能恢复稳定。
MRC 的这一特性,有助于在网络出现减速、拥塞、故障或其他可能干扰训练进程的情况下,始终保持最高的 GPU 利用率。此外,管理员还可通过统一的单一管理界面,对网络流量路径进行精细化的监控与管控。
OpenAI 表示,MRC 的多平面网络设计仅需两层以太网交换机,即可连接超过 10 万块 GPU,而采用标准 800 Gb/s 网络通常需要三到四层交换机。
MRC 规范已于近日通过开放计算项目(Open Compute Project)正式发布,并同步附有一篇学术研究论文。
Q&A
Q1:MRC 协议是什么?它主要解决什么问题?
A:MRC(多路径可靠连接)是由 OpenAI 联合 AMD、博通、英特尔、微软、英伟达共同开发的新型网络协议。它主要解决大规模 AI 训练集群中的网络拥塞问题,通过将流量同时分发至数百条网络路径,避免传统方式下少数链路因过载导致的延迟、抖动乃至训练任务崩溃,从而保障 GPU 的高效利用。
Q2:MRC 协议和传统网络方案相比有哪些优势?
A:相较于传统网络方案,MRC 主要有三大优势:一是故障恢复更快,传统网络故障后需数秒至数十秒恢复,MRC 可实时动态规避过载路径;二是架构更简洁,连接 10 万块以上 GPU 仅需两层以太网交换机,而传统方案需三到四层;三是管理更便捷,管理员可通过单一管理界面实现对流量路径的精细化监控与控制。
Q3:MRC 协议目前在哪些地方已经投入使用?
A:MRC 目前已在全球部分最大规模的 AI 训练集群中投入生产使用,包括 OpenAI 用于训练 ChatGPT 和 Codex 等前沿大语言模型的集群,以及微软 Fairwater 数据中心和甲骨文云基础设施 Abilene 数据中心(隶属于"星际之门"项目)。上述部署均采用了英伟达 Spectrum-X 以太网技术。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。