NVIDIA Vera CPU 深度解读Olympus 自研核心为什么是 Agentic AI 的关键拼图NVIDIA 昨天7 月 21 日发布了 Vera CPU 的技术博客和架构白皮书。这可能是 NVIDIA 迄今为止最详细的一次 CPU 技术披露——从 Olympus 核心的微架构到双路 NUMA 拓扑全摊开了。我读完之后最强烈的感受NVIDIA 在为 GPU 空转等 CPU 这个问题建护城河。而且这堵墙 x86 短期翻不过去。Vera vs Grace不只是迭代参数Grace (2024)Vera (2026 H2)变化核心72× Neoverse V2 授权88× Olympus 自研全自研线程72176 (空间多线程)144%解码宽度610 指令/周期67%L21 MB/核2 MB/核翻倍L3114 MB164 MB 统一43%SCF 对分带宽—3.4 TB/s全新内存带宽512 GB/s1.2 TB/s (14 GB/s/核)134%NVLink-C2C900 GB/s1.8 TB/s翻倍PCIeGen 5Gen 6.4新标准双路无单 NUMA 双路新能力FP8❌✅ 首个原生 FP8 CPU关键新能力机密计算—Arm CCA/RME 机架级可信新能力Olympus 核心微架构NVIDIA 将 Olympus 核心拆为四个子系统前端、中核、执行引擎、缓存子系统。前端10-wide Decode 神经分支预测器。当前 x86 最高Zen 5/6是 8-wideARM 公版 Neoverse V2 是 6-wideOlympus 直接拉到 10-wide——对标 Apple M 系列的设计规模。背后的支撑是神经分支预测器Neural Branch Predictor每周期处理两个 taken branch。Agent 代码全是 if-else 和动态调用分支预测命中率直接决定有效 IPC。中核价值预测 内存重命名 关键路径加速。价值预测Value Prediction——猜 load 指令会返回什么值不等 DRAM 直接继续执行后面的指令。这在学术圈研究了二十年商业 CPU 中大规模部署的极少。内存重命名Memory Renaming解决指针链的 alias 问题。关键路径加速标记最长依赖链上的指令给予优先调度。再加上大 ROB 大物理寄存器堆in-flight 指令数远超 Grace。执行引擎SVE2 FP8。6×128-bit SVE2 向量单元单线程双线程时各 3×128-bit。FP8 原生支持是 CPU 史上首次——之前的 Intel AMX 和 ARM SME 把 FP8 放在矩阵加速器里不在核心流水线中。LLM 推理前的 token 量化——过去在 GPU 上浪费 GPU 算力Vera 在 CPU 上以 FP8 精度完成直接通过 NVLink-C2C 喂给 GPU。缓存子系统图预取器Graph Prefetcher。标准 prefetcher 对规律访问有效。Agent 的数据结构完全不同——每一步地址取决于上一步取值传统 prefetcher 完全失效。图预取器通过学习内存访问中的指针模式来预测下一个 load 地址。Intel 和 AMD 的 CPU 里没见过——NVIDIA 专门为 Agent 负载做的差异化投资。空间多线程名字就叫 SMT但和你知道的那个完全不一样NVIDIA 的 Spatial Multithreading 缩写也叫 SMT。两个 SMT 的区别传统 SMTIntel Hyper-Threading两个线程共享分支预测器、解码带宽、执行单元、Load/Store 队列、L1/L2 Cache。一条线程的 cache miss 驱逐另一条的数据。结果0-30% 吞吐提升延迟完全不可预测。Vera 空间多线程Olympus 核心足够宽物理分两个线程槽。单线程模式时全部资源给一条线程兄弟线程只跑后台管理。双线程模式时资源物理平分互不干扰。结果接近 100% 吞吐提升延迟完全可预测。为什么确定性延迟对 Agentic AI 是刚需一个 Rubin GPU 集群每秒烧几千美元。如果 CPU 线程竞争导致 Kernel Launch 抖动 30ms——1 个 GPU 空转 → 72 个 GPU 一起等NVL72 紧耦合→ 1 次抖动 2.16 GPU-秒浪费。每天几千次 几万 GPU-秒。空间多线程把这种不确定性归零。x86 SMT 可以提供接近的平均延迟但无法消除尾延迟。SCF 互联与 SOCAMM2 内存子系统SCFScalable Coherency Fabric是 Vera 的片上骨干3.4 TB/s 对分带宽164 MB 统一 L3所有 88 核在单片 Die 上无跨 Die NUMA。SOCAMM2 LPDDR5X 是 Vera 在内存形态上的关键创新LPDDR 的低功耗和高带宽1.2 TB/s DIMM 的可维护性 企业级 RASECC/内存镜像/rank sparing。之前这三个需求互斥LPDDR 必须焊死才能维持短电气路径NVIDIA 通过模块化设计突破了这个限制。双路单 NUMA和 Chiplet 路线说再见x86 双路服务器的 NUMA 地狱Socket 0 内 2-4 NUMA Socket 1 内 2-4 NUMA 总共 4-8 个 NUMA 域。线程放哪、内存在哪、I/O 走哪——需要专门的性能工程师。Vera 的方案每个 Socket单 NUMA 域单片 Die 的自然结果双路 两个 NUMA 域。NVLink-C2C Gen 2 做 Socket 间互联。NVIDIA 博客原话“avoids the die-hop latency and variability common in fragmented chiplet designs”。软件优先。性能1.8× Agent 负载提升博客 Figure 6“Vera CPU delivers up to 1.8x higher performance on agentic workloads”。注意限定词“up to”——最好情况。“agentic workloads”——Python 执行、代码编译、工具驱动路径不是 SPEC 整数。“loaded single-thread performance”——全 socket 跑满 176 线程时的单线程性能不是单核空跑峰值。这个指标比单核峰值难得多88 个核心同时争抢 L3、内存带宽、SCF 对分带宽。单核的邻居越多单核越难维持高性能。Vera 在这个场景下比 Grace 好 1.8 倍。我的几个判断第一Olympus 自研核心是 NVIDIA CPU 战略的梭哈时刻。Grace 是试水ARM 公版 NVLink 包装Vera 是全栈自研——核心、互联、内存、NUMA 全部自己定义。这个跨越相当于 AMD 从 Bulldozer 到 Zen。第二神经预测器 价值预测 图预取器一起出现说明 NVIDIA 对 Agent 负载做了深度 profiling。不是比 x86 快 10%“而是x86 架构在 Agent 负载上有 30-50% 的无用功”。这三个技术没有一个是传统服务器 CPU 的标配。第三单片 Die 短期很对长期有天花板。88 核是物理极限。SCF 正在为未来多 Die 扩展做准备。Vera-next2028?必须面对 Chiplet 问题——那时 Rubin GPU 的计算密度又翻了一倍。第四NVLink-C2C 1.8TB/s 是 x86 翻不过去的结构性壁垒。不是技术问题是商业模式——Intel 和 AMD 不可能为 NVIDIA 定制 CPU-GPU 一致性互联协议。第五白皮书里的 SPEC 分数才是硬验证。博客是架构叙事1.8× 是定性结论。等拿到白皮书原文我会补上 SPEC 分析。发布时间2026年7月22日来源NVIDIA Developer Blog “Inside NVIDIA Vera CPU: Olympus Cores Built for Maximum Single-Threaded Performance in Agentic AI” (2026.7.21)、NVIDIA Vera CPU Architecture Whitepaper
Matcha-TTS C++高性能推理引擎:从ONNX模型到工业级部署实战 1. 项目概述:为什么我们需要一个C版本的Matcha-TTS?最近在语音合成圈子里,Matcha-TTS这个模型的热度一直没降下来。作为一个基于扩散模型的端到端TTS方案,它在音质和自然度上的表现确实让人眼前一亮。但玩过原版(通常是…
Slam14讲学习,再新版本的sophus的ch4代码 1.修改后的代码#include <iostream> #include <cmath> #include <Eigen/Core> #include <Eigen/Geometry> #include <sophus/so3.hpp> #include <sophus/se3.hpp>using namespace std; using namespace Eigen;int main(int argc, char **a…
虚幻引擎Pak文件解析:从原理到实战,掌握资源提取与逆向分析 1. 项目概述:为什么我们需要一个Pak文件解析工具?如果你在虚幻引擎项目开发或逆向分析中打过交道,那么对.pak文件一定不会陌生。这个后缀的文件,是虚幻引擎用于打包游戏资源——包括模型、贴图、音频、蓝图、关卡数据等所有内容—…
C++异常处理:类型匹配、继承陷阱与跨模块异常解决方案 1. 项目概述:当异常处理“答非所问”时在C的世界里,异常处理机制是我们构建健壮、容错程序的重要基石。try、catch、throw这几个关键字,理论上为我们提供了一条清晰的错误处理路径。然而,在实际开发中,尤其是面对大型项…
嵌入式以太网PHY寄存器配置:从基础原理到Tiva™实战应用 1. 以太网PHY寄存器:嵌入式网络连接的基石在嵌入式系统开发中,实现一个稳定可靠的以太网连接,远不止是拉几根网线、调用几个库函数那么简单。其底层核心,往往在于对以太网物理层(PHY)芯片的精细调控。很多开…
程序员转型大模型:3个月高效学习路线与实践 1. 程序员转型大模型的必要性分析2026年的技术职场正在经历一场深刻变革,传统编程岗位的竞争壁垒逐渐被大模型技术消解。我接触过不少工作5年以上的Java/PHP工程师,他们普遍面临两个困境:一是业务代码的重复性工作正在被Copilot类工具替代&am…
Unity Mod Manager:从原理到实战,打造安全高效的模组管理方案 1. 项目概述:为什么你需要一个专业的模组管理器?如果你是一个喜欢玩PC端Unity游戏的玩家,或者是一个热衷于为游戏创造新内容的模组开发者,那么你一定对“手动安装模组”这件事深恶痛绝。回想一下,你是不是也经历过这些…
AI智能体会话管理优化:分布式总线与冲突解决方案 1. 项目背景:当Agent数量突破管理极限在AI开发领域,我们正面临一个甜蜜的烦恼:随着各类智能体(Agent)的爆发式增长,单个项目动辄需要协调上百个Agent协同工作。这些Agent可能包括代码生成、测试验证、部署监…
从零学会服务器状态监控,日常运维必备 监控系统负载 系统负载介绍 系统负载平均值:Linux内核以活动请求数的指数移动平均值来表示。 活动请求数不仅包含运行中进程,还包含等待IO的进程,对应于R和D。等待IO包括处于睡眠等待预期磁盘和网络响应的任务。指数移动平均值是一个数学公式…
从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…
帝舵佛山**网点地址更新:2026年7月售后热线电话与服务客户指南 - 帝舵中国官方服务中心 帝舵佛山**网点地址已更新,2026年7月起售后热线电话正式启用为400-801-5381,客户指南同步发布。如需售后、维修或咨询服务,请直接拨打该全国统一**热线,服务时间每日8:00至22:00。地址信息详见下文,请按最新公布信…
亨得利盐城维修点在哪里?手表维修保养地址指南**公示(2026年7月最新) - 亨得利官方 亨得利在盐城设有**售后维修服务点,为当地及周边腕表用户提供标准化的保养与维修支持。2026年7月最新公示的全国统一客服热线为400-878-6612,服务时间为每日8:00至22:00,客户拨打时请确认使用本次公布的最新号码。*…
2026年7月最新太原百达翡丽官方售后客服电话及服务网点地址查询 - 百达翡丽官方售后中心 2026年7月,百达翡丽在太原的官方售后服务体系完成更新,客户可通过全国统一客服热线与服务网点获得直接、合规的腕表养护与维修支持。所有售后服务均遵循品牌直营标准,覆盖全国范围,客户可选择到店或邮寄方式,但需…
【JVM调优实战】16-可视化利器-JConsole-VisualVM-JMC 可视化利器:JConsole、VisualVM、JMC 实战 本文是《JVM调优实战》专栏第 16 讲。 引言 上一讲我们介绍了 JDK 命令行工具箱,它们轻量、快速,但有一个明显的短板:不直观。面对 jstat -gcutil 输出的一行行数字,你能感知 GC 频率,却难以一眼看出内存泄漏的趋势;你能用 js…
什么是PCTFE?医药高端包装的“防潮王牌“材料 ——日氟荣高分子材料(上海)有限公司 专业深耕氟材料领域很多人好奇,高端药品包装为什么比普通包装更防潮、更稳定、保质期更长?核心秘密,就藏在一种特种氟材料——PCTFE聚三氟氯乙烯里!作为国内领先的氟材…
[C++]内存管理:串顺序存储的内存回收 在串(字符串)的顺序存储中,内存回收的方式取决于字符串的存储方式以及所使用的编程语言和相关库。以下以 C 为例进行说明,因为 C 对内存管理有较为直接的控制。 1. 基于 char 数组的串顺序存储 如果使用普通的 char 数组来存储字…
移动端游戏功耗测试实战:电流、功率、亮度和场景对比 移动端游戏功耗测试:先控制变量,再比较优化是否真的省电 摘要:功耗测试最容易犯的错误,是拿两次不同温度、不同亮度、不同场景的平均功率直接比较。本文给出一套可复现的游戏功耗测试方法,覆盖引擎特性验证、版本回归和黑盒体验测试,并说明如何把功耗与帧率、温控、CPU/G…
足球口袋教练 HarmonyOS 离线应用实战(03/20):ArkUI 首页仪表盘搭建 本文是“足球口袋教练 HarmonyOS 离线应用实战”系列第 3 篇。示例项目是一个 HarmonyOS / ArkTS / ArkUI 编写的离线足球训练助手,围绕真实页面、真实截图和可复现操作展开。 本篇要解决的问题 训练 App 的首页不能只展示欢迎语,它要解决“我现在该点哪…