利用 NVIDIA Confidential Computing 的安全 AI 推理机制与优化

AI・機械学習カテゴリを表すパンダのイラスト 人工智能・机器学习

本文是由 AI 生成的技术说明与实现示例。所发布的代码和步骤基于一手信息构建,但作者并未在真实设备上进行运行验证。根据环境和版本的不同,运行结果可能会有所差异。

利用 NVIDIA Confidential Computing 的安全 AI 推理机制与优化

在企业和个人使用大型语言模型(LLM)时,为了安全处理高度机密的信息或专有的模型上下文,在可信的硬件环境中运行是必不可少的。本文基于官方技术博客的一手信息,梳理了 NVIDIA Confidential Computing (CC) 环境下高性能生产级 AI 推理的机制、推理框架 TensorRT LLM 中的适配策略,以及性能测量的方法。

本文的目的与限制

本文的目的是从官方信息中解读,在利用 NVIDIA Blackwell 架构和 Confidential Computing 的安全 AI 推理环境中,为了维持性能,框架层面进行了哪些适配。本文不进行【计划在 Windows 环境中确认】的实现或真实设备上的运行验证,而是专注于解读一手信息中记载的组件和优化方法。

前提条件与注意事项

  • 运行环境的前提:在对一手信息的评估中,使用了 NVIDIA DGX B200 系统(8个 B200 GPU)、Intel TDX 平台以及基于 Ubuntu 的主机和客体操作系统环境。

  • 未进行实机验证的限制:本文介绍的数值和测量结果均记载于一手信息中,并非由作者进行实机验证得出。

NVIDIA Confidential Computing 的组件

NVIDIA Confidential Computing 利用硬件级安全功能来保护使用中的数据和工作负载。主要组件如下。

  • 内存加密机密虚拟机 (CVM):以虚拟机为单位加密内存,防止来自宿主机侧的未授权访问。

  • 机密 GPU (Confidential GPUs):保护在 GPU 上处理的数据和计算。

  • 加密的 NVIDIA NVLink:加密 GPU 之间的通信,防止通信路径上的数据窃听或篡改。

flowchart TD
    A[セキュアなクライアント入力] --> B[CVMメモリ暗号化]
    B --> C[Confidential GPU処理]
    C --> D[暗号化されたNVLink通信]
    D --> E[安全なAI推論出力]

工作负载特征与 CC 开销的评估方法

在安全执行环境中,内存迁移、时间测量和多GPU通信的前提条件发生了变化,如果不采取对策,就会导致性能下降(开销)。一手资料指出,使开销明显暴露的工作负载特征包括:长输入上下文、扩展的输出生成以及低并发性。

  • 评估模型: nvidia/DeepSeek-R1-0528-NVFP4

  • 推理框架: TensorRT LLM(PyTorch后端)

  • I/O序列长度: 32K输入 / 1K输出

  • 并发请求数: 1, 2, 4, 8, 16

比较评估在禁用机密计算(CC off)和启用机密计算(CC on)的状态下进行,所有其他条件均保持固定。

TensorRT LLM中的CC支持适应策略

为了在安全环境中维持性能,TensorRT LLM内置了一些CC支持的适应策略(CC-aware adaptations)。

1. 主机与设备间数据传输的适应

在B200的机密计算环境中,由于GPU无法直接访问受保护的CVM内存,因此从主机到设备的传输会通过软件加密的中继缓冲区(bounce buffer)进行。

  • 主机与设备间: 已调整为选择可分页内存(pageable memory)而非固定内存(pinned memory)。

  • 设备与主机间: 将重复的令牌和采样数据回读迁移到异步工作线程,以防止受保护的复制处理阻塞主调度程序。

2. 内核自动调谐器的时序稳定

在常规环境中,使用CUDA事件来比较候选策略(tactic),但在CC环境下,CUDA事件的时间戳会导致不稳定的信号。为了避免这种情况,系统会切换为使用GPU的 %globaltimer 来执行策略测量。

3. 支持机密计算(CC)的多GPU通信选择

在 B200 的机密计算(CC)配置中,无法使用 NVLS(NVLink SHARP)的多播功能。因此,需要在框架端检测 NVLS 的可用性,并根据消息大小和拓扑结构选择最佳的通信算法。

确认方法(基于一手信息的评估指标)

根据一手信息中显示的测量结果,在 1 到 16 的并发范围内,启用机密计算(CC on)时,输出 Token 吞吐量保持在未启用机密计算(CC off)时的 96.1% 至 98.2%,平均每个 Token 的生成时间(TPOT)开销仅在 1.2% 至 4.3% 的范围内。 由于这些数据未经实机验证,因此可能与实际环境中的测量值有所不同。

局限性与总结

执行前应确认的要点与限制

  • 本文的所有内容均为基于官方技术博客的调查与解说,作者并未在实机上进行运行验证。

  • 运行情况和开销程度会因硬件代际、固件、操作系统内核以及驱动程序版本而异。

  • 在部署专属工作负载时,务必在目标环境中对开启机密计算(CC-on)和关闭机密计算(CC-off)进行对比基准测试。

总之,在引入使用机密计算的私有 AI 推理时,不能将安全配置与推理优化割裂开来,而是应当作为一项综合性的工程课题来处理。

参考信息

  • Source Title: Enabling Private High-Performance Production AI Inference with NVIDIA Confidential Computing

  • Source URL: https://developer.nvidia.com/blog/enabling-private-high-performance-production-ai-inference-with-nvidia-confidential-computing/

文档信息

文章??
利用 NVIDIA Confidential Computing 的安全 AI 推理机制与优化
?布日期
更新日期
来源
https://papanda925.com/?p=17904&lang=zh

?可: ?于本站?有相??利的正文及原??表,除非?有?明,可依据 CC BY 4.0 使用。本文可能包含使用生成式AI?建或??的内容。若代??有?可声明,或?接的GitHub???定了?可,?代?以??可?准。引用内容、第三方?料、?片及商?不在本?可范?内。 使用政策

标题和URL已复制