在当前人工智能领域对算力需求的持续增长背景下,英伟达正在对其AI加速器架构进行深入优化与迭代。业内关注的焦点之一是围绕Rubin GPU家族开发的一款专用加速器——Rubin CPX。
根据一份可追溯的公开资料,英伟达计划基于Rubin GPU家族开发一款专用加速器,该加速器被称为Rubin CPX。这一项目的重启和技术升级,标志着英伟达在优化大语言模型(LLM)推理工作流方面迈出了关键一步。
核心的技术调整体现在内存配置上:据悉,Rubin CPX将改用168GB HBM4内存。这种高带宽、大容量的内存支持是处理当前复杂AI模型计算需求的重要基础。
从功能划分的角度看,英伟达正在尝试实现预填充和解码任务的分离。具体而言,Rubin CPX GPU被设计用于承担大语言模型推理过程中的“预填充”阶段工作,负责处理输入上下文以及KV缓存;而常规的Rubin GPU则会继续负责后续的解码工作。
这种分离架构的优势在于专业化分工,它使得系统能够更高效地分配资源。例如,一个配备8块CPX GPU的机架托盘,据资料显示,可处理容量达到1.34TB的长上下文预填充数据及相关KV缓存,并且这些计算全部依靠HBM4内存完成。
在硬件规格方面,Rubin CPX采用了单片式芯片设计,其性能指标包括提供30千兆次浮点运算,即30 PFLOPS的NVFP4计算性能。此外,该芯片内部还集成了4个NVENC视频编码引擎和4个NVDEC视频解码引擎,增强了多媒体处理能力。
关于部署规模,资料指出Rubin CPX将部署在独立机架中,每个机架可以配置64至256块独立的CPX GPU。同时,英伟达建议,在负责解码的机架中,CPX GPU与常规Rubin GPU应维持1比1的配置比例。
从时间线和背景来看,此次架构调整反映了业界对LLM推理瓶颈——即长上下文处理能力不足——的深刻认知。通过将计算任务拆解到不同专业化的加速器上,英伟达旨在提升整体系统的吞吐量和效率。
需要注意的是,所有关于Rubin CPX的具体配置、性能参数以及部署建议均来源于一份可追溯的公开资料,用户应将此视为基于该单一来源的信息梳理,不代表其他未提及的技术细节或市场共识。
信息来源
本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。