
目前全球范围内专门针对 Blackwell B200/B300 双计算 die L2 Cache Coherence 协议的公开学术论文极少。NVIDIA 并未公开其具体的 coherence 协议细节如目录结构、状态机、消息格式相关研究多为逆向工程性质的微架构分析。以下是按相关度分层梳理一、直接涉及 B200 L2 Coherence 的学术论文1.Dissecting How Die Scaling Breaks GPU Fine-grained Scheduling来源arXiv:2609.24270v12026 年 9 月研究对象B200双 die、H200单 die 双 partition与 L2 Coherence 的直接关联该论文设计了一个专门的微基准测试来判定 B200 的跨 partition L2 访问模型模型 A跨 partition 读取直接从远程 L2 转发到本地 L1不经过本地 L2模型 B将数据复制到本地 L2 partition后续访问在本地命中。实验结论跨 partition 首次加载会将数据复制到本地 L2即使远程副本被失效后本地副本仍可命中~360 周期匹配本地 L2 延迟。这意味着 B200 的 L2 coherence 机制会修改本地 L2 状态产生副本、引发 evict/invalidation。论文还发现 B200 的 intra-die L2 也存在两个 memory-affinity partition每 die 内部分区通过延迟双峰分布证实。2.Microbenchmarking NVIDIA’s Blackwell Architecture来源arXiv:2512.02189v12025 年 12 月研究对象B200 双 die、NV-HBI、148 SMs与 Coherence 的关联明确提到 B200 的 dual-die 配置“four L2 cache partitions (double those in Hopper)”并通过 NV-HBI 提供 “coherent and single device to software”。论文主要聚焦张量核心和 TMEM对 L2 coherence 协议本身未做深入逆向但确认了跨 die 硬件一致性的存在。3.Microbenchmark-Driven Analytical Performance Modeling Across Modern GPU Architectures来源arXiv:2605.04178v12026 年 5 月研究对象B200 vs AMD MI300A与 Coherence 的关联将 B200 的 “NV-HBI (10 TB/s inter-die), unified 192 GB HBM3e andcache coherence” 作为架构特征列出。侧重于性能建模未剖析协议细节。二、NVIDIA 官方研究团队发表的相关工作前瞻性协议设计HMG: Extending Cache Coherence Protocols Across Modern Hierarchical Multi-GPU Systems来源NVIDIA Research2020 年 2 月作者Xiaowei Ren (UBC), Evgeny Bolotin (NVIDIA), Oreste Villa (NVIDIA)核心内容提出HMGHierarchical Multi-GPU一致性协议面向前瞻性多 GPU 系统。采用VI-like 协议跟踪一致性状态使用分层目录方案hierarchical sharer tracking来缓解 GPU 间互联带宽瓶颈。利用现代 GPU 内存模型的scoped, non-multi-copy-atomic特性避免传统协议中的 invalidation ack 和瞬态状态开销。在 4-GPU 系统上HMG 比软件批量失效机制提升 26%比非分层硬件一致性协议提升 18%。与 B200 的关联虽然发表于 Blackwell 之前但 HMG 正是 NVIDIA Research 针对分层/多 die GPU 一致性的探索。B200 的 NV-HBI coherence 很可能借鉴了类似的分层目录思想单 GPU 内双 die 可视为最简化的多 GPU层级。三、类似多 die / Chiplet GPU 架构的对比论文虽然这些不是 NVIDIA Blackwell但提供了多 die cache coherence 的设计参考论文/架构内容AMD MI300X8 个 XCD 4 个 IODInfinity Cache (256 MB) 作为统一 LLC但L2 跨 XCD 不一致一致性在 Infinity Cache 层级处理。与 B200 的全 L2 一致设计不同。Intel Falcon ShoresTile-based CPUGPU使用 EMIB 桥接但未公开详细的 tile 间 L2 coherence 协议。Cache Coherence for GPU Architectures (HPCA 2013)经典 GPU 一致性论文针对早期 Fermi/Kepler 的 write-evict、L2 writeback 策略不涉及多 die。四、非学术但权威的技术分析来源这些虽非 peer-reviewed 论文但提供了实测数据来源关键发现Chips and Cheese实测 B200 L2 partition本地命中 ~150 ns跨 partition 延迟显著增加指出 L2 partition 与 die 边界对应。NVIDIA Blackwell Technical Brief官方确认“unified 192 GB HBM3e memory space”、“coherent and single device to software”。HotChips 演讲稿Blackwell iGPU (GB10) 提到 “Hardware-enabled bidirectional coherency between CPU and GPU”展示了 NVIDIA 的 coherence 设计哲学。CSDN / tcgen05 技术解析提到 Blackwell L2 采用 “新的 MESI-X 协议变体”非官方说法疑似开发者经验推断。五、现状总结问题结论是否有论文完全解密 B200 L2 coherence 协议没有。NVIDIA 未公开协议状态机、消息格式、目录结构。最接近的学术论文arXiv:2609.24270v1(2026-09)通过微基准测试逆向工程了 B200 跨 partition L2 的复制行为和NUMA 效应。NVIDIA 官方相关研究HMG (2020)NVIDIA Research 提出的分层多 GPU 一致性协议可视为思想前身。协议类型推测基于微基准测试推断B200 可能采用目录式协议Directory-based配合 L2 partition 间的数据复制 失效机制而非简单的 snooping。如果需要深入研究建议重点关注arXiv:2609.24270v1“Dissecting How Die Scaling Breaks GPU Fine-grained Scheduling”这是目前对 B200 L2 coherence 行为最硬核的逆向工程分析。