
1. 从AI Infra到Agentic Infra一场算力范式的深度迁移最近和几个做AI应用落地的朋友聊天大家普遍有个感受模型能力越来越强但把模型真正用起来、用好反而越来越“重”了。以前我们聊AI基础设施脑子里蹦出来的关键词是“GPU集群”、“分布式训练框架”、“模型仓库”。但现在一个更复杂、更动态的需求场景正在成为主流Agentic Infra或者说面向智能体Agent的基础设施。这不仅仅是名词的替换背后是整个AI算力底座设计哲学的重构。华为云最近提出的“极致重构AI算力底座”在我看来正是对这一趋势的深刻回应。它瞄准的不再是单纯喂给模型海量Token进行训练而是如何高效、稳定、经济地支撑起成千上万个具备自主决策和行动能力的智能体在真实世界里“跑”起来。简单来说AI Infra关心的是“如何把模型练出来”它的核心指标是训练吞吐量Tokens/sec和模型精度。而Agentic Infra关心的是“如何让模型用起来”它的核心指标变成了推理延迟Latency、并发处理能力QPS、长上下文Long Context的稳定处理以及至关重要的——成本效率Cost per Inference。当你的应用从一个简单的问答机器人升级为一个能调用工具、检索知识、规划步骤、与环境持续交互的智能体时它对底层算力的需求会发生质变。这就像从修建一条供车辆行驶的高速公路AI Infra转变为构建一个能实时调度成千上万辆自动驾驶汽车、处理复杂路况和突发事件的智能交通系统Agentic Infra。为什么这个转变如此关键因为智能体的工作流是非确定性的和状态化的。一次用户查询可能触发智能体进行多轮“思考”调用大模型、多次“行动”调用API、查询数据库、并维护复杂的会话状态。这个过程对算力的消耗是脉冲式、不可预测的且对响应时间极其敏感。传统的、为批量训练设计的静态算力池在这里会显得笨重而低效。华为云提出的“极致重构”其深层逻辑我认为正是为了应对这种从“确定性训练”到“非确定性服务”的范式挑战。接下来我们就拆开看看这场重构具体发生在哪些层面以及它如何解决我们实际部署智能体时遇到的真实痛点。2. 算力底座的核心挑战当Token不再是唯一度量衡在纯粹的模型训练阶段我们评估基础设施的核心是“吞Token”的能力。就像新闻里提到的“某模型单日吞下8万亿Token”这彰显的是其数据吞吐和并行计算规模。然而到了Agentic场景Token的流动方式变得复杂无比。首先长上下文Long Context成为标配而非可选。一个智能体需要记住长达数十万甚至百万Token的对话历史、工具调用结果和外部知识片段才能做出连贯的决策。这对显存特别是KV Cache的管理提出了极致要求。传统的做法是简单粗暴地分配大块显存但这在同时服务多个智能体时会造成严重的资源碎片和浪费。更优的解决方案需要动态的、细粒度的显存调度机制能够根据会话的实际长度实时调整KV Cache的占用类似一个智能的内存分配器。这要求算力底座的软件栈与硬件如高带宽内存深度协同而不仅仅是堆砌显存容量。其次推理的“潮汐效应”与混合负载。智能体服务不像训练任务那样可以长时间平稳运行。它的负载呈现出强烈的波峰波谷用户集中提问时并发请求激增智能体内部可能同时进行多个子任务如并行调用多个搜索API空闲时则几乎无负载。这种模式对算力的弹性伸缩能力要求极高。同时负载类型也是混合的既有对大型模型的重度推理思考步骤也有对小型模型或专用模型的轻量级推理工具判断还可能穿插着大量的数据检索和状态更新IO操作。一个僵化的、同构的算力集群无法高效处理这种混合负载。再者状态持久化与故障恢复的复杂性。智能体是有状态的它的记忆、目标、已执行步骤都需要在服务实例间或持久化存储中可靠地保存。当某个计算节点发生故障这在超大规模集群中是常态如何快速将智能体的状态迁移到健康节点并恢复执行而不丢失上下文或导致任务逻辑错乱这需要一套精密的、应用感知的故障转移和状态同步机制这远远超出了传统容器编排系统如Kubernetes提供的无状态服务重启能力。最后成本与效能的精细平衡。在Agentic场景下每一次推理都直接关联用户体验和商业价值。盲目使用最强大的模型处理所有请求成本会失控但过度降级模型又可能影响任务完成质量。因此基础设施需要具备智能路由和模型级联的能力能根据查询的复杂度自动将其路由到不同规模的模型上执行能在一次智能体调用中动态组合使用大小模型例如用小模型做意图分类用大模型做复杂规划。这要求底层的网络和调度系统能实现极低延迟的模型间切换和数据传递。华为云所强调的“重构”正是要直面这些挑战。它不是对原有AI算力栈的修补补而是从架构设计之初就将Agentic工作流的这些特性作为第一性原则来考量。3. 架构重构从静态集群到动态感知的“神经中枢”那么一个面向Agentic Infra的算力底座在架构上应该长什么样它绝不仅仅是把更多的GPU塞进机房而是构建一个能感知应用、动态调优的“神经中枢”。我们可以从几个关键层面来理解这种重构。3.1 算力资源池的异构化与细粒度切分传统的AI算力池往往是同构的例如全是A100 80G通过虚拟化或容器化分配整卡或半卡资源。这种方式在Agentic场景下粒度太粗浪费严重。新的架构需要支持异构算力不同型号的GPU、甚至CPU、NPU的统一纳管与调度。更重要的是支持亚卡级Sub-Device的算力切分与隔离。这意味着单个物理GPU可以被安全、高效地划分为多个更小的实例分别运行不同的模型或服务不同的智能体会话。例如将一个40G显存的GPU划分为4个10G显存的虚拟实例分别运行一个7B参数的模型服务其总服务吞吐量可能远高于让这个GPU单独服务一个70B模型。这需要硬件如GPU的MIG多实例GPU技术和调度器如Kubernetes Device Plugin的增强的深度配合。华为云在这一点上的积累可能正是其重构算力底座的重要一环通过软硬件协同实现算力资源的“颗粒化”供应。3.2 面向“工作流”而非“单次推理”的调度器这是Agentic Infra与AI Infra最核心的区别。传统的模型服务调度器如Triton Inference Server的调度策略主要优化单次模型推理的排队与执行。而智能体的执行是一个包含多个步骤的工作流Workflow例如用户输入 - 意图识别模型 - 知识检索 - 规划模型 - 行动执行 - 结果合成 - 输出。新的调度器需要以整个工作流为单元进行调度和优化。它需要能够识别工作流依赖知道步骤B必须等待步骤A的结果。进行跨步骤的资源预留与协同调度避免规划模型在等待检索结果时其占用的计算资源空转。实施全局优先级策略对于交互式智能体请求其工作流整体优先级应高于批量处理任务。支持有状态工作流的故障恢复当工作流某个步骤失败调度器能根据持久化的状态和日志从断点恢复或重新调度整个工作流。这相当于将一部分业务流程编排Orchestration的能力下沉到了基础设施层让算力调度能理解应用的语义。这能极大降低上层Agent框架的复杂性并提升整体执行效率。3.3 内存与存储体系的重新设计长上下文是Agentic的基石也带来了最大的内存压力。除了前面提到的动态KV Cache管理重构的存储体系还需要解决两个问题高速的层化存储Hierarchical Storage将智能体的状态、会话历史、知识库索引等数据根据访问频率和延迟要求分别存放在GPU HBM高速缓存、CPU内存、NVMe SSD高速本地盘和分布式对象存储中。基础设施需要智能地预取和换出数据确保热数据触手可及冷数据也有地方可存。例如当前活跃会话的上下文放在HBM最近24小时的会话历史放在本地SSD更早的历史归档到对象存储。向量检索与模型推理的紧耦合智能体的知识检索尤其是基于向量的语义检索与模型推理是强相关的。传统架构中检索服务与模型服务往往是分离的需要网络往返增加延迟。新的架构探索将向量索引的一部分如最近邻图缓存在GPU内存甚至HBM中实现检索与推理的“近计算”Near-Compute甚至“在计算中”In-Compute完成这能大幅降低复杂Agent工作流的端到端延迟。4. 软件栈革新开发与运维体验的重塑强大的硬件和架构最终需要通过软件栈交付给开发者。Agentic Infra的软件栈目标是将开发者从繁琐的底层设施管理中解放出来更专注于智能体本身的逻辑与业务价值。4.1 一体化的智能体开发与部署平台未来的平台可能会提供从智能体编排、测试、到一键部署、监控的全链路工具。开发者可以用高级语言如Python定义智能体的工作流、工具集和记忆策略平台则自动将其编译、优化并部署到前述的异构算力底座上。它可能提供可视化工作流编排器像搭积木一样设计智能体的决策逻辑。内置的常用工具库封装好对数据库、API、搜索引擎等调用的安全访问模式。仿真测试环境在部署前对智能体进行大规模、并发的模拟测试评估其成本、延迟和成功率。这类似于云原生时代的Kubernetes之于应用部署将智能体应用的“基础设施即代码”理念推向成熟。4.2 可观测性与调试能力的根本性提升调试一个行为不可预测的智能体比调试一个传统的微服务要困难得多。当出现“Token交换失败”、“登录错误”或“403 Forbidden”这类问题时正如热搜词中频繁出现的各种Token相关错误我们需要穿透整个复杂的调用链。新的软件栈必须提供深度可观测性全链路追踪Distributed Tracing能够追踪一个用户请求穿越了智能体的多少次“思考-行动”循环每次调用了哪个模型、哪个工具耗时多少消耗了多少Token。思维过程Chain-of-Thought日志能够记录和回放智能体内部的推理过程在安全合规的前提下这对于分析其决策错误原因至关重要。成本与性能的实时仪表盘不仅显示总体QPS和延迟更能下钻到每个智能体、每个工作流、甚至每个工具调用的成本Token消耗折算和性能。当出现“token endpoint returned status 403 forbidden”时运维人员应能快速定位到是哪个智能体、在调用哪个外部API时、由于何种授权或配额问题导致了失败而不是在茫茫日志中大海捞针。4.3 安全与合规的内置设计智能体能够自主调用工具和访问外部资源这带来了巨大的安全风险。Agentic Infra必须将安全作为核心特性来设计而不是事后附加。工具调用的沙箱与权限控制每个智能体对工具如读写数据库、发送邮件的访问权限必须被严格定义和执行。输入/输出内容过滤与审计防止提示词注入Prompt Injection或模型输出有害内容。数据隐私与合规确保智能体处理用户数据的过程符合相关法规例如在特定区域不将数据传出边界。这些能力需要被深度集成到运行时和调度器中形成默认的安全基线。5. 实战推演以“企业级智能客服助手”为例让我们通过一个具体的场景来看看重构后的Agentic Infra如何解决实际问题。假设我们要构建一个企业级智能客服助手它不仅能回答问题还能执行查订单、退换货、预约服务等复杂操作。传统架构下的痛点资源浪费为应对高峰咨询需常备一个能处理最大并发的大模型集群闲时资源大量闲置。响应慢用户问题涉及查订单时智能体需要先调用订单查询API拿到结果后再让模型生成回复。这个串行过程导致响应延迟高。状态管理复杂一个退换货流程可能跨越多次对话。需要开发者自行实现会话状态的存储、恢复和超时管理代码复杂且易错。调试困难当用户反馈“助手答非所问”时很难复现当时的完整决策链条。基于Agentic Infra的重构方案动态弹性伸缩与混合负载调度平台根据实时对话量自动伸缩不同规格的模型实例。简单问候直接路由到轻量级低成本模型复杂多步操作才启用大模型。算力调度器能识别“查询API-等待-生成回复”这个工作流并尝试在等待IO时让GPU处理其他请求提升整体利用率。工作流并行化优化对于“查订单并解释”这类任务平台可以自动将“调用订单API”和“根据订单号生成解释性文案”这两个子任务并行执行最后合成结果缩短响应时间。平台托管的状态服务开发者只需声明“本会话需要维护一个退货申请状态”平台即提供高可用的、持久化的状态存储并自动处理会话超时、状态清理和故障转移。内置的全链路追踪每个客服对话都有一个唯一的Trace ID。出现问题时运营人员可以在控制台输入该ID直接看到本次对话中智能体的完整思维链、每一步调用的工具、消耗的Token以及各步骤耗时快速定位问题是出在模型理解、工具API还是网络延迟。通过这个例子可以看到Agentic Infra的价值在于它通过底层设施的革新将智能体应用开发中最棘手、最通用的非业务问题资源、性能、状态、可观测性接管了过去让开发者能聚焦于业务逻辑本身。6. 技术实现的深水区Token经济与效能优化当我们谈论Agentic Infra时一个无法回避的核心经济指标就是Token消耗。在智能体频繁的“思考-行动”循环中每一次调用模型都意味着Token的消耗也就是成本的产生。因此基础设施的优化必须深入到Token层面。动态上下文窗口与选择性记忆不是所有历史对话都需要完整地塞进模型的上下文窗口。高级的Agentic Infra可以集成“记忆压缩”或“摘要”模块自动将长篇对话历史压缩成关键要点只在需要时展开细节。这能显著减少每次推理消耗的Token数量。例如平台可以自动将过去十轮关于产品规格的问答总结为“用户已了解产品A的尺寸和重量并询问价格”仅将此摘要送入下文而非全部原始对话。推理优化技术的全面应用这包括但不限于量化Quantization将模型权重从FP16降低到INT8甚至INT4在精度损失可控的前提下大幅降低显存占用和计算延迟。平台需要能自动为不同工作负载选择最合适的量化模型。推测解码Speculative Decoding使用一个小型、快速的“草稿模型”先生成多个Token再由大型“验证模型”快速批处理验证从而加速大模型的推理速度。这需要调度器能协调两个模型的协同工作。持续批处理Continuous Batching在模型服务端高效地合并来自不同智能体、不同长度的推理请求最大化GPU利用率。这对于处理大量并发但请求大小不一的智能体场景至关重要。成本感知的调度与路由调度器在分配请求时不仅要考虑延迟和资源利用率还要考虑Token成本。它可以基于历史数据学习不同类型任务如“创意写作” vs. “代码生成”在不同模型上的成本-效果曲线从而实现全局成本最优的调度策略。例如将简单的信息提取任务路由到成本更低的模型集群。7. 生态与开放避免新的“供应商锁定”任何基础设施的演进都必须考虑生态的开放性。华为云提出重构AI算力底座如果真想成为Agentic时代的基石就必须构建一个开放的、标准化的生态。这包括对主流Agent框架的深度支持如LangChain、LlamaIndex、AutoGen等。基础设施应提供原生的SDK和运行时环境让基于这些框架开发的智能体能够无缝迁移、高效运行而不是要求开发者绑定到某套特定的编程模型或API。模型兼容性与开放性支持业界主流的开源和闭源模型格式如GGUF、Safetensors、Hugging Face Transformers格式并提供高效的转换与部署工具。避免制造一个只能运行特定格式模型的“围墙花园”。标准化接口的提供围绕智能体的生命周期管理、可观测性、工具调用等逐步形成或采纳行业事实标准类似Kubernetes的CRD。这能让上层的管理工具、监控平台、安全产品更容易地与底层设施集成繁荣整个生态。重构的终极目标应该是让开发者感觉不到基础设施的复杂性却能享受到它带来的所有红利极致的性能、弹性的成本、坚固的可靠性和全面的可观测性。就像我们今天开发Web应用不再需要关心服务器的物理位置一样未来开发智能体应用也应不再需要为算力调度、状态管理和长上下文优化而绞尽脑汁。这场从AI Infra到Agentic Infra的迁移是一次从“资源视角”到“服务视角”的升维。它要求云服务商不仅提供强大的算力更要提供智能的、应用感知的算力服务能力。华为云的这次“极致重构”可以看作是对下一代AI应用形态的一次重要押注和基础性投入。对于广大AI应用开发者而言这意味着我们即将拥有一个更强大、更趁手的“武器库”去构建那些曾经因为基础设施限制而难以实现的、真正智能的、自主的AI应用。当然具体的实现效果如何还需要在实际的打磨和社区的检验中见真章。但方向无疑是清晰的。