华步万新闻 · 资料整理

英伟达重启Rubin CPX项目,计划采用168GB HBM4内存用于AI加速器开发

根据公开资料显示,英伟达计划基于Rubin GPU家族开发专用加速器Rubin CPX。该CPX GPU主要用于大语言模型推理的预填充阶段,并采用了168GB HBM4内存。其设计目标是将预填充和解码任务分离,提升处理长上下文的能力。

华步万新闻 · 资料整理

在当前人工智能领域对算力需求的持续增长背景下,英伟达正在对其AI加速器架构进行深入优化与迭代。业内关注的焦点之一是围绕Rubin GPU家族开发的一款专用加速器——Rubin CPX。

根据一份可追溯的公开资料,英伟达计划基于Rubin GPU家族开发一款专用加速器,该加速器被称为Rubin CPX。这一项目的重启和技术升级,标志着英伟达在优化大语言模型(LLM)推理工作流方面迈出了关键一步。

核心的技术调整体现在内存配置上:据悉,Rubin CPX将改用168GB HBM4内存。这种高带宽、大容量的内存支持是处理当前复杂AI模型计算需求的重要基础。

从功能划分的角度看,英伟达正在尝试实现预填充和解码任务的分离。具体而言,Rubin CPX GPU被设计用于承担大语言模型推理过程中的“预填充”阶段工作,负责处理输入上下文以及KV缓存;而常规的Rubin GPU则会继续负责后续的解码工作。

这种分离架构的优势在于专业化分工,它使得系统能够更高效地分配资源。例如,一个配备8块CPX GPU的机架托盘,据资料显示,可处理容量达到1.34TB的长上下文预填充数据及相关KV缓存,并且这些计算全部依靠HBM4内存完成。

在硬件规格方面,Rubin CPX采用了单片式芯片设计,其性能指标包括提供30千兆次浮点运算,即30 PFLOPS的NVFP4计算性能。此外,该芯片内部还集成了4个NVENC视频编码引擎和4个NVDEC视频解码引擎,增强了多媒体处理能力。

关于部署规模,资料指出Rubin CPX将部署在独立机架中,每个机架可以配置64至256块独立的CPX GPU。同时,英伟达建议,在负责解码的机架中,CPX GPU与常规Rubin GPU应维持1比1的配置比例。

从时间线和背景来看,此次架构调整反映了业界对LLM推理瓶颈——即长上下文处理能力不足——的深刻认知。通过将计算任务拆解到不同专业化的加速器上,英伟达旨在提升整体系统的吞吐量和效率。

需要注意的是,所有关于Rubin CPX的具体配置、性能参数以及部署建议均来源于一份可追溯的公开资料,用户应将此视为基于该单一来源的信息梳理,不代表其他未提及的技术细节或市场共识。

信息来源

本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。