英伟达近日发布技术博文,详细解析了专为智能体AI场景设计的Vera CPU架构特性。这款处理器通过优化核心设计、内存子系统及互连架构,重点解决智能体AI工作负载中单线程性能、并发延迟可预测性及不规则数据结构处理等关键挑战。
智能体AI的运行模式对CPU提出特殊要求:在沙箱环境中执行代码、调用工具、检索上下文数据、与数据库交互并分析结果后,需将处理后的信息精准反馈给模型。这类场景需要处理器在满负载状态下保持单线程性能优势,同时为每个核心提供充足内存带宽以支持多执行上下文,并确保并发操作下的延迟稳定性。
Vera CPU的核心设计围绕Olympus架构展开,采用四模块化设计:前端集成10宽解码引擎,支持每周期处理2个分支指令,其神经分支预测器可显著提升复杂分支模式的预测精度;核心中段优化指令调度效率;执行引擎针对不规则控制流进行专项强化;缓存子系统则通过164MB统一L3缓存实现核心间数据快速共享。该处理器单芯片集成88个Olympus核心,支持176个SMT线程,通过动态资源分配机制平衡单线程高负载与多线程密度需求。
在数据传输层面,NVIDIA可扩展相干互连(SCF)架构提供最高3.4TB/s双向带宽,连接核心、缓存、内存控制器及NVLink-C2C接口。内存子系统采用SOCAMM2 LPDDR5X技术,聚合带宽达1.2TB/s,单核带宽14GB/s,特别针对高并发AI、图计算等场景优化数据供给效率。扩展性方面,双路配置通过第二代NVLink-C2C实现核心间一致性,提供176条PCIe 6.4通道并支持CXL 3.1协议。
安全架构基于Arm CCA/RME框架构建,支持按虚拟机分配加密密钥,并通过C2C链路加密技术保护跨处理器数据传输。该设计在保持性能的同时,为金融、医疗等敏感领域提供硬件级安全隔离能力。













