首页
学习
活动
专区
圈层
工具
发布

英伟达BlueField如何为智能体AI工厂提供极致协同设计

智能体AI重塑AI工厂基础架构模式

智能体AI的兴起从根本上改变了AI工厂的基础架构模式。一次请求在生成最终答案之前,可能触发大量模型调用、工具调用、内存查找、策略检查、存储访问和网络传输。随着更多智能体并发运行,并在步骤、用户、工具、服务和会话之间携带上下文,基础架构必须具备足够快的数据移动、保护、检索和复用能力,才能保持GPU和CPU的高效运转。

英伟达BlueField平台在AI工厂数据路径中引入了专用的、可编程的基础架构处理能力。BlueField将基础架构工作从主机CPU卸载出去,加速数据移动,内联执行策略,并支持上下文复用。这些能力有助于实现更高的GPU利用率、更可预测的延迟、更强的隔离性、更低的每Token成本以及更高的每瓦Token产出等生产级目标。

该平台将专用基础架构处理器、存储处理器与面向AI工厂的英伟达DOCA软件相结合。英伟达BlueField-4 DPU负责从主机CPU卸载、加速并隔离网络、存储、安全、遥测和控制平面服务,同时加速GPU计算与CPU计算系统之间的数据移动。英伟达Vera BlueField-4 STX存储处理器则为上下文内存、高性能存储基础架构以及AI工厂中的安全数据服务提供支撑,驱动全新一类数据平台的诞生。

在上述处理器之上,英伟达DOCA提供了软件基础,用于在网络、存储、安全、遥测和生命周期管理等领域构建和运营相关服务。在英伟达Vera Rubin平台及更广泛的面向AI工厂的英伟达DSX架构中,BlueField提供加速基础架构,DOCA则提供可编程软件模型,用于在整个数据中心部署这些服务。

智能体AI推动基础架构需求升级

智能体AI将推理从模型执行延伸至跨越GPU、CPU、内存、网络、存储和安全的分布式工作流。每个步骤都依赖于数据移动、上下文保存、策略执行以及AI工厂中各服务的协同,使基础架构数据路径成为推理流水线的重要组成部分。

GPU负责执行模型推理并生成Token,CPU则通过执行工具、处理检索结果、准备提示词、验证输出以及协调后续推理步骤来编排智能体运行时。基础架构还必须保存并检索支撑推理跨轮次持续进行的上下文。

上下文的保存与检索对KV缓存尤为关键。在预填充阶段,大语言模型会生成存储中间注意力状态的KV缓存数据。随着提示词、对话和智能体工作流的增长,缓存状态需要越来越多地跨推理步骤持久化,并在请求之间复用。当GPU内存受限时,系统会驱逐并重新计算KV缓存、限制上下文长度,或将状态迁移至其他内存层级,从而在延迟、吞吐量或成本之间引入权衡。这使得KV缓存成为基础架构数据路径的一部分,必须在不拖慢推理的前提下完成移动、放置、保护和检索。

由此,基础架构不再只是推理的辅助环节,而是已成为推理流水线的核心组成部分。网络、存储、安全、遥测、控制平面服务以及上下文内存管理,都必须在不延迟GPU推理或占用智能体执行所需主机CPU资源的前提下处理智能体流量。

BlueField:AI工厂的专用基础架构处理器

智能体推理需要一条快速、安全、可编程的基础架构数据路径。BlueField正是为该路径提供专用基础架构处理器,在AI工厂中实现连接、安全、隔离和加速。

BlueField-4在Rubin GPU和英伟达Vera CPU中担任数据处理单元(DPU),Vera BlueField-4 STX存储处理器则服务于英伟达CMX上下文内存与AI原生存储。在这些角色中,BlueField将高速网络、嵌入式基础架构计算、本地内存、PCIe连接、内联加速、隔离能力与DOCA可编程性融为一体,构建出协调统一的AI工厂数据路径。

BlueField-4 DPU集成了高达800 Gb/s的以太网或InfiniBand连接、64核英伟达Grace CPU、高带宽LPDDR5X内存、PCIe Gen6、面向网络、存储、安全和数据移动的内联加速,以及DOCA软件平台。与BlueField-3相比,其网络带宽翻倍,计算性能提升最高6倍,内存容量提升4倍,内存带宽提升超过3倍。

BlueField-4 STX存储处理器则融合了英伟达Vera CPU、英伟达ConnectX-9超级网卡、高达1.6 Tb/s的Spectrum-X以太网连接、高性能NVMe存储访问、加速数据移动、硅级安全以及DOCA可编程性。

DOCA使BlueField基础架构处理域具备可编程性,通过库和微服务提供构建和部署加速基础架构服务的软件基础。它为开发人员、运维人员和独立软件供应商提供了一种统一的方式,用于创建和运营BlueField及ConnectX加速服务,以适应KV缓存复用、租户隔离、存储元数据、拥塞控制、安全配置以及新型智能体运行时模式等不断变化的需求。

极致协同设计实现资源均衡

网络只有在嵌入式计算、内存带宽、PCIe、加速和软件能以相同速度处理流量时,才能真正提升交互性。额外的计算能力只有在具备足够内存容量、I/O带宽和可编程服务时,才能提升吞吐量。BlueField经过协同设计,对这些资源进行了平衡,使基础架构流量能够在到达之处得到处理。

高速连接将AI工作负载、存储、安全和控制流量引入AI工厂数据路径。BlueField的嵌入式计算和高能效LPDDR5X内存将服务逻辑和状态保持在靠近被处理数据的位置,包括队列、策略、元数据、遥测以及KV缓存放置信息。PCIe Gen6、VirtIO和DOCA SNAP存储虚拟化使主机能够使用标准的主机可见网络和存储设备模型,并由BlueField加速支撑,从而降低主机CPU开销。

随着智能体请求在AI工厂中流转,数据包得到传送,并触发RDMA传输、存储命令、策略检查、元数据查找和遥测事件。BlueField加速处理相关的流量引导、数据移动、存储访问、加密、完整性验证和策略执行,使基础架构服务能够跟上智能体流量,而无需消耗主机CPU资源。

DOCA将这一硬件基础转化为AI工厂的可编程服务,包括:

DOCA基于主机的网络(HBN):支持服务器端三层路由,BlueField充当BGP路由器,适用于可扩展的多租户设计。

BlueField ASTRA:支持Spectrum-X零信任、多租户裸金属部署,BlueField与ConnectX-9协同,充当跨多个基础架构平面的受管控制点。

DOCA Memos:帮助跨计算和存储节点管理和共享KV缓存,使上下文能够在长上下文和智能体推理中复用。

DOCA安全服务:支持零信任访问、策略执行、运行时可见性和隔离,保护AI工厂中的数据、推理和智能体。

上述能力共同将网络、存储、安全、上下文管理和控制服务保持在数据路径附近,而非与主机CPU资源竞争,从而帮助BlueField提升GPU利用率、降低推理延迟、增强多租户隔离、降低每Token成本并提高每瓦Token产出。

Vera Rubin平台的协同设计架构

极致协同设计意味着AI工厂被设计为一个相互依存的系统。每个组件都有明确的角色,与其他组件形成互补,使平台能够在生产工作负载下持续保障吞吐量、交互性、隔离性和Token效率。

Vera Rubin平台专为需要高吞吐量推理、密集CPU执行、大规模上下文内存和安全数据移动的智能体AI工作负载而构建。在该平台中,Rubin GPU提供加速计算,Vera CPU支持工具调用、编排和数据移动,NVLink提供纵向扩展通信,ConnectX-9和Spectrum-X支持横向扩展网络。BlueField贯穿整个系统,涵盖计算、网络、存储和安全各层面。

GPU性能依赖于整个系统保持加速器持续获得工作任务、数据和安全连接的能力。BlueField-4在GPU计算托盘中充当基础架构处理器,支持前端(南北向)网络、主机CPU卸载、安全数据访问、管理、可观测性和基础架构隔离。通过卸载和隔离这些服务,BlueField有助于避免GPU计算受到主机CPU开销、变化的访问控制或管理流量的制约。

南北向路径对GPU至关重要,因为它将用户请求、检索数据、上下文、存储流量和管理服务引入Rubin计算层。BlueField-4扩展并保障了该前端路径,而内联基础架构处理在消耗主机CPU资源之前完成相关网络、存储、安全和遥测工作。更高的前端带宽和更低的主机CPU竞争有助于改善GPU的数据和上下文可用性,支持在AI工厂中实现更可预测的推理延迟和更高的每用户每秒Token产出。

Vera CPU与智能体执行层

智能体AI和强化学习增加了对CPU性能的需求,因为智能体需要执行工具调用、运行代码、浏览或查询数据、转换输入、解析输出、评估结果并编排工作流。Vera CPU凭借高单核性能、并发能力和高能效内存带宽,能够在AI工厂规模下运行这一CPU执行层。BlueField-4则围绕Vera CPU工作负载提供基础架构处理层,负责前端网络、存储访问、安全与隔离、配置、策略、遥测和管理。

这种分离至关重要,因为智能体CPU工作负载处于推理循环内部。如果基础架构服务消耗主机CPU资源或引入调度抖动,即使GPU计算资源充足,工具执行、检索和验证也可能变慢。BlueField在DPU域中处理网络、存储、安全和控制平面服务,使Vera CPU能够将更多时间用于智能体执行,而非基础架构工作。

CMX上下文内存与KV缓存管理

智能体AI将上下文转变为活跃的基础架构数据。多轮智能体、长上下文推理、检索增强工作流和多智能体系统生成可复用的推理状态(包括KV缓存),这些状态必须在不拖慢推理的前提下完成存储、共享、保护和检索。

英伟达CMX上下文内存存储平台在GPU内存和可扩展共享存储之间,为推理上下文创建了一个可共享、可扩展且高能效的AI原生存储层。它通过Vera BlueField-4 STX存储处理器提供针对KV缓存优化的以太网接入闪存层,该存储处理器融合了Vera CPU、ConnectX-9网络和DOCA Memos。

存储处理器在靠近存储和网络路径的位置运行KV I/O、元数据管理、数据放置、安全和控制操作。它不将闪存呈现为块存储,而是跟踪KV元数据、管理队列、支持缓存召回和预暂存、执行租户策略并处理数据保护。将这些控制密集型、延迟敏感型操作放置在存储处理器中,有助于在上下文增长时保持交互性。

借助DOCA Memos,CMX能够跨AI计算和CMX数据节点管理和共享KV缓存,使其成为一个主动的上下文内存数据路径,而非被动的存储层。KV缓存复用减少了重复预填充、上下文重新计算、GPU空闲时间和不必要的数据移动,提升了长上下文和智能体工作负载的每秒Token产出和电力效率。

AI工厂的零信任安全架构

智能体AI改变了安全模型,因为智能体在AI工厂中反复访问数据、模型、工具、上下文内存和推理服务。它们可能在生成最终答案之前处理专有或受监管的数据、模型状态、嵌入向量和KV缓存,这使得数据、推理和智能体行为都成为安全攻击面。

AI工厂的安全不能仅依赖主机软件。驻留在主机上的安全控制与其所保护的工作负载共享资源和信任边界,若主机遭到入侵,可能面临篡改或规避风险。BlueField将安全处理移至硅级并置于主机工作负载域之外,在保留CPU和GPU资源用于AI工作的同时,强化了控制边界。

对于多租户AI工厂,这实现了内联保护而不拖慢数据路径。BlueField提供可信的基础架构控制点,用于跨计算、存储和推理基础架构实现租户隔离、网络策略执行、安全访问、运行时检测、加密和遥测。DOCA通过面向零信任数据访问、推理保护、智能体行为可见性和网络级隔离的可编程服务扩展了这一模型,帮助在智能体工作负载扩展时保护模型、数据集、上下文内存和运行时交互。

总结

智能体AI使基础架构成为推理流水线的核心组成部分,要求AI工厂在不拖慢GPU、CPU或上下文内存的前提下完成数据的移动、保护、检索和复用。BlueField为网络、存储、安全、遥测和上下文服务提供加速基础架构处理,DOCA则使这些服务具备可编程性并可在整个数据中心部署。BlueField-4、Vera BlueField-4 STX和DOCA共同帮助AI工厂提升交互性、隔离性、GPU利用率,并降低每Token成本、提高每瓦Token产出。

Q&A

Q1:英伟达BlueField-4 DPU有哪些核心规格?与上一代相比提升了多少?

A:BlueField-4 DPU集成了高达800 Gb/s的以太网或InfiniBand连接、64核英伟达Grace CPU、高带宽LPDDR5X内存、PCIe Gen6,以及面向网络、存储、安全和数据移动的内联加速能力。与BlueField-3相比,BlueField-4的网络带宽翻倍,计算性能提升最高6倍,内存容量提升4倍,内存带宽提升超过3倍。

Q2:DOCA Memos在KV缓存管理中起到什么作用?

A:DOCA Memos帮助跨计算和存储节点管理和共享KV缓存,使上下文能够在长上下文和智能体推理中复用。通过减少重复预填充、上下文重新计算、GPU空闲时间和不必要的数据移动,KV缓存复用能够提升每秒Token产出和电力效率,让CMX平台成为主动的上下文内存数据路径,而非被动的存储层。

Q3:BlueField如何提升AI工厂的安全性?

A:BlueField将安全处理移至硅级并置于主机工作负载域之外,避免了主机软件安全控制与工作负载共享资源和信任边界的风险。它为多租户AI工厂提供内联保护,支持租户隔离、网络策略执行、安全访问、运行时检测、加密和遥测。DOCA进一步通过可编程服务扩展了零信任数据访问、推理保护和智能体行为可见性等能力。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/O26YTBlmmDIoDZ1vucjPP7hg0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券