在人工智能基础设施面临性能、延迟和能耗等挑战的当下,英国初创公司 Oriole Networks 宣布了一项具有开创性的举措。该公司表示,正通过所谓的全球大规模光子 AI 网络应对这些难题,此网络将作为英国研究与发明机构 (ARIA) 扩展推理实验室的一部分进行部署。
此次公告标志着一种新兴的人工智能基础设施方法的出现,其优化重点从处理器转移到了互连架构。这也展示了欧洲光子学公司与主要半导体供应商合作,提高下一代人工智能数据中心效率的新模式。
Oriole 正在与 AMD 展开合作,将其 PRISM 光子网络平台与 AMD Instinct GPU 和 EPYC CPU 集成到价值 5000 万英镑(约合 6800 万美元)的 ARIA 扩展推理实验室中。双方的合作已持续一年多,旨在评估光子网络如何降低延迟并大规模提高 AI 推理吞吐量。
与传统依赖电子交换的数据中心网络不同,PRISM 采用纳秒级光路交换技术,直接以光子形式路由数据。据 Oriole 公司称,在网络核心中用光路交换取代电子交换机,可将功耗降低 81%,同时将 GPU 空闲时间从约 60% 降至 1% 以下。这使得相同的硬件能够运行更多推理工作负载,大大提升了系统效率。
AMD 计算与企业 AI 业务副总裁 Madhu Rangarajan 表示:“AMD 很高兴能与 Oriole 合作开发 ARIA Scaling Inference Lab 集群。Oriole 独特的 AI 后端网络采用纳秒级光路交换技术,为大规模连接加速器提供了全新的方式。我们正在协助验证光子结构与 AMD 计算技术协同工作的效果,以提供 AI 推理工作负载所需的低延迟、高带宽连接。”
此次部署也是 Oriole 历经三年研发后的首次商业应用。该公司表示,其与 xPU 无关的架构现已终定型,并计划于 2027 年在更广泛的行业范围内部署,支持来自多家供应商的加速器平台,而非仅限于专有生态系统。
Oriole 执行官 James Regan 称:“一年前,我们还在验证物理原理;如今,我们已进入验证商业价值的阶段。我们与 AMD 的合作从概念走向部署,构建了规模大十倍的系统,数据表明系统性能得到了显著提升。这意味着光子网络不再只是研究热点,而是构建严肃人工智能基础设施的重要基础。”
ARIA 扩展推理实验室的成立,旨在研究解决大规模人工智能推理瓶颈的技术。该项目除了有 AMD 提供硬件和技术支持外,还致力于评估光子结构等新兴网络技术对未来人工智能数据中心性能和能效的提升作用。
由英国议会法案设立、英国科学、创新与技术部赞助的 ARIA 基金,致力于资助突破性研发。规模化推理实验室作为获得 5000 万英镑资助的测试平台,旨在解决人工智能工作负载的关键瓶颈问题。英国商业、贸易和经济发展大臣彼得?凯尔表示,该系统将成为催化剂,有助于吸引新投资,支持高技能就业岗位增长,提升英国初创企业的全球竞争力。
在此项目中,Oriole 贡献了 PRISM 光子网络解决方案,以纳秒级光路交换取代网络核心的电子交换机;AMD 则提供 CPU 和 GPU 硬件及技术合作,开发和运行与前沿人工智能系统相关的大规模网络模型。
PRISM 作为世界上以光子而非电信号形式传输数据的 AI 网络平台,具有显著优势。几十年来,数据中心网络依赖的电开关效率低下、耗电量大且发热严重。随着人工智能的发展,数据中心网络已难以承受成千上万个芯片每秒交换数万亿次数据的需求。而 PRISM 完全摒弃电子开关,采用纳秒级光路切换,不仅降低了核心功耗,减少了 GPU 空闲时间,还减少了对复杂网络硬件供应链的依赖,降低了冷却需求和用水量。同时,它能显著提升 AI 性能,同一硬件可服务更多用户。更重要的是,PRISM 不依赖单一芯片供应商,可在任何加速器平台上运行,为整个行业提供了通往前沿规模系统级性能的途径。
ARIA 项目总监 Suraj Bramhavar 表示:“满足现代人工智能的需求,需要迅速找到提高大规模人工智能集群性能和成本效益的方法。ARIA 很高兴能与 Oriole 和 AMD 合作,展示这项新技术的优势。这正是创新型初创企业与行业合作的意义所在,也是扩展推理实验室所促进的合作模式。”