![[论文学习]机密LLM推理:CPU与GPU TEE间的性能与成本权衡](http://pic.xiahunao.cn/yaotu/[论文学习]机密LLM推理:CPU与GPU TEE间的性能与成本权衡)
Confidential LLM Inference: Performance and Cost Across CPU and GPU TEEsIISWC 2025论文重点本文由ETH Zurich的Marcin Chrapek、Marcin Copik、Etienne Mettaz和Torsten Hoefler完成发表于IISWC 2025。研究首次系统性地评估了在CPU TEEIntel SGX/TDX和GPU TEENVIDIA H100 Confidential Compute中运行完整Llama2推理管线7B、13B、70B的性能表现。核心发现是CPU TEE的吞吐量开销低于10%、延迟开销低于20%GPU TEE的吞吐量损失仅为4–8%且随着批处理规模和输入长度的增大而进一步降低——这表明机密计算已具备在实际生产环境中部署LLM的可行性。核心研究内容问题定义大语言模型正越来越多地部署在融合了云和高性能计算的基础设施上。然而LLM处理的是机密用户输入且微调依赖于昂贵、专有的数据集其高安全性要求在医疗、金融等隐私敏感行业中严重阻碍了落地。如何在保障端到端推理机密性的同时最小化性能损耗是亟需解决的核心矛盾。创新方法论文提出了系统性的跨平台TEE评估框架CPU侧在Intel TDXTrust Domain Extensions和SGXSoftware Guard Extensions中运行完整Llama2推理管线并利用AMXAdvanced Matrix Extensions进行加速。GPU侧在NVIDIA H100 Confidential Compute GPU上运行推理首次将CPU与GPU TEE的机密推理性能置于同一评估框架下进行对比。多维度分析从性能、成本和安全性三个维度综合权衡CPU与GPU TEE的优劣。研究成果CPU TEE在各种数据类型、批处理规模和输入长度下吞吐量开销低于10%延迟开销低于20%AMX可进一步降低这些开销。GPU TEENVIDIA H100 Confidential Compute GPU的吞吐量损失为4–8%且随批处理和输入规模增大而递减。成本对比在某些场景下CPU TEE比GPU TEE更具成本效益或安全性优势。研究共提炼了12条关键洞察为机密LLM托管提供了实用指南。实际落地应用的可能性高。论文证明TEE带来的性能开销已控制在可接受范围内10%吞吐量损失机密LLM推理不再停留在理论层面。医疗机构的病历分析、金融机构的合同审查、法律文书处理等场景均可受益。特别是CPU TEE方案在成本敏感型场景中具有显著优势。技术细节硬件加速关键技术AMXIntel Advanced Matrix ExtensionsAMX是内置于第四代至强可扩展处理器Sapphire Rapids及后续产品中的矩阵乘法加速单元。AMX引入了二维寄存器文件tile和专用指令集可显著提升矩阵乘法的吞吐量。论文中AMX被用于加速TEE内的LLM推理有效降低了机密计算带来的性能开销。关键性能数据来自相关解读对于int8量化模型CPU TEE的开销从9–11%降至批处理规模为64时的≤6%对于bfloat16格式开销从7–10%降至批处理规模为512时的4–7%。这说明更大的批处理规模和更低的数值精度有助于摊薄TEE的固定开销。量化技术的协同作用论文探索了量化技术与TEE的结合路径。量化如int8本身可减少模型大小和内存带宽需求与TEE配合时能进一步放大性能优势。这一组合策略对实际部署极具参考价值。研究设定硬件配置CPUIntel Xeon Sapphire RapidsSPR或Emerald RapidsEMR第四代或更新代次GPUNVIDIA H100 80GB主机操作系统Ubuntu 24.04软件栈与工具链SGX使用Gramine框架运行enclave应用TDX使用TDX guest tools生成机密VM镜像磁盘空间需≥200GB70B模型要求推理框架基于Intel Extension for PyTorchIPEX构建Docker容器模型Llama2 7B、13B、70B实验变量研究考察了多种数据类型int8、bfloat16等、不同批处理规模以及输入长度变化对性能的影响。综合分析为什么CPU TEE的开销反而可能低于GPU TEE这是一个反直觉但值得深思的发现。GPU TEE如NVIDIA H100 Confidential Compute需要在CPU和GPU之间建立安全的通信通道并对GPU内存进行加密保护。这些额外的安全机制引入了跨设备数据传输和内存加密的开销。而CPU TEE如TDX是在CPU内部完成内存加密数据无需跨设备传输。对于某些工作负载这种“一体化”的设计反而更具优势。12条洞察的含义虽然论文未公开全部12条洞察的细节但从已有信息可知研究涉及了NUMA效应和大页面大小等CPU架构层面的考量。这意味着TEE的性能不仅取决于加密开销还与底层硬件拓扑和内存管理策略密切相关。实际部署中合理的NUMA绑定和大页面配置可能是提升性能的关键。成本分析的战略意义论文指出CPU TEE可以比GPU TEE“便宜甚至100%”。虽然GPU在原始算力上远胜CPU但GPU TEE的硬件成本、功耗和云服务定价都显著更高。对于推理延迟要求不那么极端的场景CPU TEE可能是更优的经济选择。实践应用场景选择决策树场景特征推荐方案理由低延迟要求、高吞吐需求、预算充足GPU TEEH1004–8%开销算力充沛成本敏感、批处理量大、可接受中等延迟CPU TEETDX/AMX10%开销成本优势显著超大规模模型70B、高并发CPU TEE 量化更大内存容量成本可控极端隐私要求、需要完整内存加密TDX或SEV-SNPVM级隔离攻击面更小部署建议优先尝试TDX而非SGXTDX提供VM级别的机密计算编程模型更接近传统云环境迁移成本更低。量化与TEE配合使用int8量化可将TEE开销从10%降至6%是实现高性能机密推理的有效手段。关注批处理规模TEE的固定开销在小批量时更为显著适当增大批处理规模可有效分摊开销。考虑混合部署对延迟敏感的部分用GPU TEE对成本敏感的部分用CPU TEE实现性能和成本的精细平衡。参考资料原始论文https://ieeexplore.ieee.org/document/11241987arXiv预印本https://arxiv.org/abs/2509.18886