
摘要当一家企业的业务跨越多个区域、多种合规体系怎么把 AI 跑起来就不再是单纯的算力问题而是混杂了数据主权、网络延迟、成本结构与团队能力约束的系统工程。2026 奇点智能技术大会11 月 20-21 日 · 北京万达文华酒店AI Infra 基础设施与 AgenticOps专题中Google Cloud 解决方案架构师张宇驰将带来全球化视角的一线经验。本文先行拆解云上 AI 的三层架构、企业上 AI 的四类典型失败姿势、不可回避的多云约束以及 AI 时代成本治理FinOps的变形为正在规划 AI 基础设施的团队提供可参考的判断框架。一、为什么 AI Infra 需要全球化视角很多 AI Infra 讨论默认一个隐含前提所有计算都在同一个云、同一个区域、同一套合规体系内完成。但对出海企业与跨国业务而言这个前提几乎不成立。全球化视角带来三类新增约束。其一是数据主权不同区域对用户数据的跨境流动有不同规定数据能否出境、能否用于训练、能否由第三方模型处理都会直接改变架构设计而不是事后的合规补丁。其二是延迟与可用性模型推理链路上的网络往返、跨区调用、单点依赖决定了终端体验也决定了容灾设计是否可行。其三是成本结构差异同一款加速器在不同区域的单价、供给充足度、闲置成本都可能相差显著这会让集中训练 分散推理变成更常见的形态。单区域假设训练/推理同区 → 架构简单治理成本低 全球化现实数据主权 延迟 成本差异 → 必须分层解耦忽视这些约束的典型后果是架构在国内跑得很好一旦复制到海外就出现合规停工或成本失控。解决方案架构师的价值恰恰在于提前把这些隐性假设显性化。二、云上 AI 的三层架构与决策点从大量企业实践抽象云上 AI 基础设施可以划分为三层每层的决策点并不相同层级核心命题关键决策常见误区算力层用什么算加速器选型、配额、拓扑只比峰值算力忽略供给稳定性平台层怎么编排调度、服务化、多租户隔离把平台做成一次性脚本数据层数据怎么流血缘、主权、缓存与归档数据与算力分家链路冗长算力层最常见的问题是把选型压缩成哪张卡更快。在真实生产里供给稳定性、网络拓扑、故障率、以及 supply 的可获得性往往比峰值算力更能决定交付节奏。平台层的关键是把能跑变成能被多个团队稳定使用。这需要调度策略、服务化接口、配额与隔离、以及可观测性四件套。把平台做成一次性脚本的代价是第二个团队上船时必须重造一遍。数据层最容易被低估。由于训练、微调、检索、评测会反复访问同一批数据数据放哪里、怎么缓存、跨境如何合规会长期影响性能与成本。数据离算力越远链路越贵也越脆。三、企业上 AI 的四类典型失败姿势按照出现频率排序企业 AI 落地最常见的失败可以归纳为四类。第一类先买算力再想用例。在没有明确负载画像的情况下采购资源结果往往是高峰期不够、平时闲置。合理顺序是先画出负载曲线——训练是脉冲型、在线推理是持续型、批处理是弹性型再按曲线匹配采购与弹性策略。第二类PoC 与生产之间的鸿沟。演示环境里单卡跑通的模型进入生产后遇到多租户干扰、冷启动延迟、依赖版本漂移。跨越这道鸿沟需要提前定义服务等级目标SLO而不是等出问题再补。第三类把安全当上线前的检查项。AI 系统涉及数据访问、模型调用、Agent 工具权限等多个新攻击面事后补加固的成本远高于设计阶段内建隔离。第四类成本没有归口。多个团队共享资源池却无人对总账单负责导致局部最优、全局失控。这一条在 AI 场景被显著放大因为单次训练的费用可能超过过去一个季度的总支出。四、多云与混合不可回避的现实约束理论上集中在一个云最简单但现实中企业往往必须面对多云或混合部署。驱动因素通常包括合规要求、区域可用性、议价能力、以及历史遗留。多云策略的关键取舍在于标准化层放在哪里。如果把标准化放在最底层例如统一虚拟机规格与网络会被云厂商差异拖垮合理的做法是在较高的抽象层标准化# 以统一的服务接口吸收底层差异classInferenceService:def__init__(self,provider):self.backendprovider.build_backend()# 不同云的适配实现defpredict(self,payload,slo_ms200):withtracer.start_span(inference)asspan:span.set_attributes({slo:slo_ms,provider:self.backend.name})resultself.backend.invoke(payload)metrics.observe_latency(result.latency_ms,slo_ms)returnresult这段代码体现了三条工程原则接口统一、延迟可观测、SLO 显式化。有了这三条底层换云、换区域、换加速器形态对上层业务的冲击都被限制在适配层内。需要提醒的是多云不等于随时可迁移。真正的可迁移性依赖标准化层的数据格式、身份体系与部署描述这三项若不统一多云只会变成双倍运维负担。不要把多云当作保险而要为它付出持续的一致性成本。五、FinOpsAI 时代成本治理的变形传统 FinOps 的核心是可见、可归、可优化。进入 AI 时代后这套方法的难点发生了位移。可见性更难因为一笔费用可能横跨训练作业、推理服务、向量库、数据出口流量且短时间内剧烈波动。归因更难因为多团队共享集群与模型服务需要按请求而非按主机分摊成本。优化更难因为很多开销与模型选择耦合换模型的代价不仅是钱还有质量回归。可落地的应对方式包括为每个服务标注明确的业务归属标签按请求粒度采集 token 消耗与耗时建立单位业务成本指标如每千次对话成本让成本随业务而非随资源来讨论。成本视角升级资源成本 → 请求成本 → 单位业务成本 只有到第三层优化讨论才可能与业务目标对齐六、给出海企业的落地清单结合上述讨论建议出海或跨国业务团队按以下顺序推进先厘清每个区域的数据边界与合规红线再确定数据与算力的相对位置然后定义清晰的 SLO 与容灾目标最后才是加速器与服务的选型。这个顺序看似把技术决策放在最后却恰恰能避免最常见的返工——因为合规与延迟约束一旦确定可选的技术方案范围会大幅收敛决策反而更快。七、从 PoC 到生产被低估的三笔工程量在交流与实践中一个反复出现的现象是团队用两周做出了令人满意的演示却花了半年才把它推上线。这段落差的来源通常不是模型不够强而是三笔容易被跳过的工作量。第一笔是服务化。在演示里直接调用函数即可进入生产则需要请求排队、批处理、优先级调度、超时与重试、优雅降级。尤其当多个业务共享同一推理集群时缺少优先级会让关键请求被低价值的批处理挤占前端体验直接崩塌——这也是很多演示很惊艳、上线很卡顿的根源。第二笔是可观测性。需要按请求维度采集 token 消耗、首 token 延迟、端到端耗时与失败原因分布并把这些信号与业务指标关联。没有这层数据任何优化都只能依靠猜测故障发生时也难以快速定位是模型、网络还是依赖服务的问题。第三笔是变更管理。模型版本、Prompt 版本、检索索引版本三者必须被统一管理与灰度发布。大量线上事故的真实原因并非模型变弱而是 Prompt 或索引在无记录的情况下被修改导致行为漂移却无法回滚。PoC 关注能不能做出来 生产关注能否稳定、可归因、可回滚地持续做下去把这三笔工作量提前计入排期是从演示走向交付的关键。跳过它们并不会节省时间只会把成本转移到事故之后的救火过程中——而那时的代价通常是此时的数倍。八、架构评审的六个必答问题在进入正式实施前建议团队用一页纸回答以下六个问题它们覆盖了全球化 AI Infra 最容易返工的决策点其一数据能否出境、能否用于训练——这决定了推理是本地化还是跨境调用。其二哪些场景允许使用第三方模型——涉及个人信息与交易数据的场景往往需要受控部署。其三延迟预算是多少——端到端 200 毫秒与 2 秒的预算会导向完全不同的部署形态。其四单区域故障时的降级路径是什么——是否需要多活、能否接受分钟级切换。其五成本由谁承担、如何分摊——没有明确归口的资源池最终都会失控。其六团队是否具备运维这套系统的能力——复杂的多云架构若无对应人力其实际可靠性往往低于简单的单区域方案。这六个问题里前两个属于合规红线答错会直接导致方案作废中间三个属于工程设计答错会导致返工最后一个最常被忽略却决定系统能否长期健康运行。把资源投入与团队能力对齐比追求架构先进性更重要。九、大会前瞻11 月 20-21 日北京万达文华酒店2026 奇点智能技术大会。在 AI Infra 议题上国内视角国产算力、集群调度、 KV Cache 管理与全球视角多云、数据主权、成本治理恰好互补。张宇驰的分享为正在做出海规划或多云架构的团队提供了一组在国内实践中较少被系统讨论的约束条件。带着如果业务明天要复制到另一个区域哪些假设会失效这个问题去听收获会远比听一次技术介绍更大。大会信息2026 奇点智能技术大会 C 及系统软件技术大会时间2026 年 11 月 20-21 日地点中国·北京万达文华酒店大会报名链接点击报名参会立即报名锁定 Lukasz Kaiser Keynote 与 70 场演讲完整资料