本文是由 AI 生成的技术说明与实现示例。所发布的代码和步骤基于一手信息构建,但作者并未在真实设备上进行运行验证。根据环境和版本的不同,运行结果可能会有所差异。
利用 NVIDIA Confidential Computing 的安全 AI 推理机制与优化
在企业和个人使用大型语言模型(LLM)时,为了安全处理高度机密的信息或专有的模型上下文,在可信的硬件环境中运行是必不可少的。本文基于官方技术博客的一手信息,梳理了 NVIDIA Confidential Computing (CC) 环境下高性能生产级 AI 推理的机制、推理框架 TensorRT LLM 中的适配策略,以及性能测量的方法。
本文的目的与限制
本文的目的是从官方信息中解读,在利用 NVIDIA Blackwell 架构和 Confidential Computing 的安全 AI 推理环境中,为了维持性能,框架层面进行了哪些适配。本文不进行【计划在 Windows 环境中确认】的实现或真实设备上的运行验证,而是专注于解读一手信息中记载的组件和优化方法。
前提条件与注意事项
运行环境的前提:在对一手信息的评估中,使用了 NVIDIA DGX B200 系统(8个 B200 GPU)、Intel TDX 平台以及基于 Ubuntu 的主机和客体操作系统环境。
未进行实机验证的限制:本文介绍的数值和测量结果均记载于一手信息中,并非由作者进行实机验证得出。
NVIDIA Confidential Computing 的组件
NVIDIA Confidential Computing 利用硬件级安全功能来保护使用中的数据和工作负载。主要组件如下。
内存加密机密虚拟机 (CVM):以虚拟机为单位加密内存,防止来自宿主机侧的未授权访问。
机密 GPU (Confidential GPUs):保护在 GPU 上处理的数据和计算。
加密的 NVIDIA NVLink:加密 GPU 之间的通信,防止通信路径上的数据窃听或篡改。
flowchart TD
A[セキュアなクライアント入力] --> B[CVMメモリ暗号化]
B --> C[Confidential GPU処理]
C --> D[暗号化されたNVLink通信]
D --> E[安全なAI推論出力]
工作负载特征与 CC 开销的评估方法
在安全执行环境中,内存迁移、时间测量和多GPU通信的前提条件发生了变化,如果不采取对策,就会导致性能下降(开销)。一手资料指出,使开销明显暴露的工作负载特征包括:长输入上下文、扩展的输出生成以及低并发性。
评估模型:
nvidia/DeepSeek-R1-0528-NVFP4推理框架: TensorRT LLM(PyTorch后端)
I/O序列长度: 32K输入 / 1K输出
并发请求数: 1, 2, 4, 8, 16
比较评估在禁用机密计算(CC off)和启用机密计算(CC on)的状态下进行,所有其他条件均保持固定。
TensorRT LLM中的CC支持适应策略
为了在安全环境中维持性能,TensorRT LLM内置了一些CC支持的适应策略(CC-aware adaptations)。
1. 主机与设备间数据传输的适应
在B200的机密计算环境中,由于GPU无法直接访问受保护的CVM内存,因此从主机到设备的传输会通过软件加密的中继缓冲区(bounce buffer)进行。
主机与设备间: 已调整为选择可分页内存(pageable memory)而非固定内存(pinned memory)。
设备与主机间: 将重复的令牌和采样数据回读迁移到异步工作线程,以防止受保护的复制处理阻塞主调度程序。
2. 内核自动调谐器的时序稳定
在常规环境中,使用CUDA事件来比较候选策略(tactic),但在CC环境下,CUDA事件的时间戳会导致不稳定的信号。为了避免这种情况,系统会切换为使用GPU的 %globaltimer 来执行策略测量。
3. 支持机密计算(CC)的多GPU通信选择
在 B200 的机密计算(CC)配置中,无法使用 NVLS(NVLink SHARP)的多播功能。因此,需要在框架端检测 NVLS 的可用性,并根据消息大小和拓扑结构选择最佳的通信算法。
确认方法(基于一手信息的评估指标)
根据一手信息中显示的测量结果,在 1 到 16 的并发范围内,启用机密计算(CC on)时,输出 Token 吞吐量保持在未启用机密计算(CC off)时的 96.1% 至 98.2%,平均每个 Token 的生成时间(TPOT)开销仅在 1.2% 至 4.3% 的范围内。 由于这些数据未经实机验证,因此可能与实际环境中的测量值有所不同。
局限性与总结
执行前应确认的要点与限制
本文的所有内容均为基于官方技术博客的调查与解说,作者并未在实机上进行运行验证。
运行情况和开销程度会因硬件代际、固件、操作系统内核以及驱动程序版本而异。
在部署专属工作负载时,务必在目标环境中对开启机密计算(CC-on)和关闭机密计算(CC-off)进行对比基准测试。
总之,在引入使用机密计算的私有 AI 推理时,不能将安全配置与推理优化割裂开来,而是应当作为一项综合性的工程课题来处理。
参考信息
Source Title: Enabling Private High-Performance Production AI Inference with NVIDIA Confidential Computing
Source URL: https://developer.nvidia.com/blog/enabling-private-high-performance-production-ai-inference-with-nvidia-confidential-computing/

