ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

AI对电力的巨大需求:背后的物理学与复杂经济学

2026/9/20 19:44:04 拓冰建站 浏览量
AI对电力的巨大需求:背后的物理学与复杂经济学 数据中心——那些没有窗户、外观呆板、鲜少有人注意的箱形建筑——今年竟意外成为美国这个分裂社会中罕见的团结议题。似乎人人都对它心生厌恶。数据中心建设热潮的背后是人们对人工智能的极大兴趣这项技术对计算能力的需求前所未有。惠誉集团预测今年五大超大规模云服务商将在数据中心建设上投入7500亿美元其中四分之三将用于AI相关项目。然而人们对AI冲击就业的担忧加上数据中心对社区、电网和水资源造成破坏性影响的认知引发了大量不满情绪。Heatmap上周发布的一项调查显示四分之三的美国人现在反对在自己所在社区新建数据中心。活动人士已在数十个州组织了130多场抗议活动。这一议题甚至已成为即将到来的中期选举中的热门话题。关于数据中心电力和水资源消耗及相关环境影响的事实和令人担忧的预测很难被反驳。2023年数据中心的用电量约占美国全部电力消耗的4.4%预计到2028年这一数字将增至三倍。全球范围内数据中心的电力消耗预计到2030年将翻一番达到相当于日本全国全年用电量的水平。部分计算机科学家估计到2035年数据中心可能消耗全球20%的电力。对电力的渴求同时伴随着同样惊人的用水需求这些水用于防止高密度服务器机柜过热。一个大型数据中心每天可消耗高达500万加仑的水相当于一座5万人口城市的用水量。联合国估计明年全球AI需求将消耗相当于丹麦全年用水总量的水资源。机制差异为什么AI会消耗如此多的能源简而言之这是因为AI处理的运行机制打破了传统软件和云计算的经济规律。软件公司只需编写一次代码就能将其托管在多租户服务器上新增用户带来的边际成本几乎可以忽略不计。生成式AI打破了这一模式迫使科技行业不得不应对热力学、材料极限和资源稀缺方面的新挑战。在现代聊天机器人简洁的界面背后隐藏着一套规模空前的物理基础设施——由处理器、高速光纤网络、水冷塔和在物理极限下运转的电网组成的庞大而饥渴的系统。传统软件的边际成本非常低因为计算主要发生在用户设备上或者依托更廉价的多租户基础设施完成分布式PostgreSQL数据库制造商Yugabyte公司开发者关系副总裁安德鲁·马歇尔表示。而AI推理在每一次交互中都会产生真实的计算成本。这意味着AI很可能永远无法接近传统软件那种可规模化的经济模式。传统软件运行同一套代码路径可服务多达数百万用户马歇尔说。而AI应用为每个用户执行不同的计算。这正是它值得付费的原因但也正是这一点瓦解了软件行业赖以维持利润率的缓存复用机制。根据国际能源署的数据向OpenAI公司的ChatGPT这样的AI助手提交一次查询所需电力可能是传统谷歌搜索的10倍之多。使用生成式AI模型生成一段5秒的视频其耗电量相当于家用微波炉连续运转一个多小时。AI目前也正受到杰文斯悖论的影响这是19世纪经济学家威廉·斯坦利·杰文斯首次观察到的一种令人警醒的现象即便处理效率提高需求的增长也会抵消甚至超过单位能耗的节省从而导致总体消耗上升。超大规模云服务商、新云服务提供商以及数十家初创公司都在致力于降低AI处理的能耗但对更多算力的需求仍在飙升专注构建智能缓存编排引擎的Lightbits Labs公司AI产品与业务高级副总裁拉梅什·切图维提表示。尽管Lightbits Labs声称其技术能将现有图形处理器的容量提升多达16倍但这对(总体)GPU容量不会产生任何影响他说。目前根本无法满足需求。AI技术还太新预测需求充其量只是有根据的猜测。尽管过去两年模型提供商一直在大幅削减Token成本但AI项目仍然是一项高度不可预测的运营支出而非固定的资本资产。高德纳公司预测到2028年至少一半的生成式AI项目将超出预算。这一切都引出一个问题为什么AI如此昂贵技术创新能否推动其在性价比曲线上进一步下降达到与传统软件相当的水平简短的回答是不太可能。GPU税AI成本危机的根源在于执行高性能计算所需的物理硬件。与运行在通用中央处理器上的传统软件不同生成式AI模型几乎完全依赖专用并行处理器——主要是图形处理器或谷歌公司的张量处理器——以更高效地运行AI工作负载。这种专业化已造成严重的供应链瓶颈使AI基础设施从一项软件工程挑战转变为一场资本密集度极高的硬件争夺战。GPU高昂成本的根源在于两个相互关联的因素半导体制造成本和内存的物理极限。高性能芯片在进入服务器机柜之前需要经过数百道工序和专门资源的加工。例如处理AI工作负载的芯片必须使用超纯水来清洗制造过程中产生的微量硅残留物。一座半导体制造厂每天可消耗多达1000万加仑的超纯水。由于生产一加仑超纯水大约需要1.5加仑自来水一家典型的芯片工厂每天要消耗1500万加仑的市政用水相当于约3.3万户家庭的用水量。然后是内存墙问题。大语言模型不仅仅是处理一个查询它必须将由数千亿个参数组成的整个权重矩阵加载到本地内存中。为应对这些操作所需的高强度数据传输速率硬件制造商必须部署专用的、昂贵的高带宽内存通过垂直堆叠内存芯片来加快数据传输速度。这引发了一场残酷的全球资源争夺战。据《大西洋月刊》报道AI公司目前购买了全球约70%的高端计算机内存供应导致其他领域出现严重短缺。消费级计算机内存和硬盘存储的价格因此飙升部分笔记本电脑的成本上涨幅度高达50%。尽管这些硬件集群的成本高得惊人——一块高端GPU价格可达数万美元——但实际生产中硬件的利用效率却出人意料地低。GPU集群的平均利用率通常仅为10%到12%。这正是内存匮乏的直接后果。由于GPU计算数据的速度远快于内存架构的供给速度处理器在大量活跃时钟周期中都在等待内存数据的读取。为弥补这一问题运营商常常过度配置容量在技术栈的每一层都预留集群资源以确保能够应对突发的、不可预测的流量峰值。这导致成本结构严重失衡运营商为持续、满功率的硬件容量支付全款却只使用了其中的一小部分。AI之所以昂贵是因为你要在每一层都预留容量但实际使用的只是其中一部分Yugabyte公司的马歇尔说。需求是波动的没有人想成为那个资源不够用的环节。Lightbits Labs公司AI架构总监亚瑟·拉斯穆森回忆起曾与一家大语言模型提供商合作的经历对方运营着一个价值十亿美元的集群大部分时间利用率仅为10%只为应对偶发的流量激增。你可能会感到震惊他谈及典型的利用率数据时说道。训练与推理模型训练是AI生命周期中资源消耗最密集的阶段但从长期来看它并非电力和水资源消耗的最大来源。训练过程需要将海量数据集输入神经网络以调整其数十亿个参数这一过程需要数千个高端处理器以最大容量连续运行数月之久。训练的电力需求惊人。据《经济学人》报道Meta平台公司的Llama 3.1模型训练需要27.5吉瓦时的能量足以为7500户美国家庭供电一年。但训练是一次性的固定资本支出可以分摊到未来数百万次交易中。而推理——即对实时工作负载的处理——才是更大的开销。据《经济学人》报道杰富瑞金融集团分析师布伦特·蒂尔估计推理占AI数据中心能耗的96%。这一成本是现代深度学习两个架构性限制的直接后果二次方复杂度和自回归执行循环。传统软件之所以资源效率高是因为其通常呈对数或线性扩展。这意味着随着输入规模的增长处理它所需的计算时间增长缓慢。大语言模型则呈二次方扩展这意味着它们必须计算提示词中每一个单词或Token与其他所有单词或Token之间的数学关系。输入文档规模翻倍所需的内存和计算量就会增加四倍。这种扩展惩罚因自回归而进一步加剧这是一种模型利用自身过去的输出作为输入来预测序列中下一个数据点的技术。自回归通过用概率模拟思维过程弥补了计算机无法像人类那样进行推理的不足。人类可以在脑海中构思出整句话但大语言模型必须完整执行一次神经网络的前向传播才能预测出下一个Token或数据块——模型用它来读取、写入和处理信息。输出结果会被附加到之前的文本中整个组合字符串再被重新输入模型用于预测下一个Token。这一过程假设未来将遵循过去的模式。这意味着要生成一个1000个Token的回复GPU必须让其数十亿参数通过这一数学循环运行1000次。每一次交互都是一次资源密集型计算无法轻易被缓存或跳过。结果就是长对话、文档摘要或多轮软件开发任务可能迅速变得极其消耗计算资源。降低成本和能耗最简单的方法就是让AI模型少做一些事情。给模型输入数百万个数据点实质上是在把GPU算力浪费在本可以用台式计算机完成的计算上。一个模型能够摄入数十万甚至数百万个Token并不意味着它就应该这么做专注于资本市场AI推理系统开发的Opetek公司创始人兼CEO瓦尔卡·阿比亚内表示。他说大语言模型擅长理解模糊问题、分解复杂问题以及选择分析方法等任务。而传统计算机擅长对数百万个数据点进行计算且成本要低得多。Opetek公司名为Arius的AI推理系统将模型所需的数据与可以更低成本地在Python程序或Excel中处理的数据分离开来。这种方法在某些金融场景中实现了超过90%的成本削减。阿比亚内表示这种方法可用于任何数据密集型场景。目标不应该是最小化推理他说而应该是把推理用在能创造价值的地方。智能体前沿随着从简单的、由人类驱动的聊天界面向自主智能体工作流的持续转变AI推理的财务和物理需求被进一步放大。与等待提示词的聊天机器人不同AI智能体可以自主运行执行多步骤的业务工作流、调用工具并直接与其他软件交互。这导致可变Token的数量急剧膨胀。人类用户受限于阅读和打字的物理速度但机器对机器的智能体循环可以在几秒钟内执行数千次交易。Anthropic公司估计多智能体系统消耗的Token数量约为单轮人类聊天会话的15倍。国际数据公司预测到2029年全球活跃部署的AI智能体数量将超过10亿个约为去年使用量的40倍。智能体之所以如此贪婪是因为它们实际上并不进行思考而是在相同的数据上反复循环。CloudZone公司财务运营团队负责人阿维凯·哈图夫在一篇经过SiliconANGLE审阅的文章中写道如果一个工程助手被要求修复应用程序中的一个错误它会执行构建、遇到失败然后调用本地工具进行排查。为了做出决策它会提取数千行冗长的容器日志、深层的JSON结构化负载以及相同的数据库模式将整个数据块移回云端大语言模型的上下文窗口中他写道。如果第一次修复失败智能体会重复整个循环。每次这种情况发生时智能体都会将相同的数据库模式和元数据通过网络重新传输到远程端点。这些多轮会话中传输的绝大部分数据并非高价值的逻辑代码或知识产权而是基础设施噪音哈图夫写道。Token浪费在YouTube频道Computerphile的一段视频教程中诺丁汉大学计算机科学副教授迈克尔·庞德演示了这种Token浪费如何在几分钟内消耗掉6万到10万个Token仅仅是为了修复一个简单的错误。尽管每个Token的成本只有几分之一美分但在成百上千个任务中累积起来成本——以及能耗——会迅速攀升。智能体很容易在你甚至没有要求的情况下消耗大量的计算周期国际数据公司云与数据中心基础设施集团副总裁戴夫·麦卡锡表示。目前几乎没有什么断路器机制。人为的低效率也无济于事。AI技术太新很少有组织已经重新配置好数据和流程以帮助模型发挥最佳性能。高德纳表示其预测的预算超支很大程度上是架构设计不佳、缺乏运营管控等根本性缺陷造成的。如果一个AI系统不知道某个字段的含义、哪个指标是权威的、数据来自哪里或者数据是否可信它就必须在工作过程中自行摸索这些问题专注于数据情境化平台开发的The Modern Data公司联合创始人兼首席技术官阿尼梅什·库马尔表示。重试、不必要的上下文以及对相对简单的任务使用强大的模型这些都会增加计算量。专注于开源PostgreSQL数据库管理系统商业版销售的EnterpriseDB公司首席营销官迈克尔·盖尔表示数据源的碎片化会带来额外开销因为它要求AI模型从多个数据库中提取信息增加了数据重复也消耗了更多Token。盖尔将数据库管理系统比作一台只会偶尔被打开和关闭的冰箱。而AI则本质上是在不停地访问这台冰箱每次都要消耗电力。在AI的世界里你必须实实在在地每天86000秒都在拉取数据他说。他估计通过对数据进行向量化处理组织可以将推理成本削减10%从而使多个连续操作能够并行执行。如果你能在数据层解决能耗问题就能为处理更大规模的挑战赢得更多灵活性他说。缓解措施数据中心运营商和模型开发者都清楚地意识到当前这种依靠蛮力扩展AI的方式在经济和环境层面都是不可持续的。目前有众多举措正在推进力求在不损害准确性或性能的前提下降低能耗。短期内最有前景的方法是量化技术。在标准机器学习中模型参数通常以高精度的32位浮点数存储。量化技术可将这些权重压缩至低至4位。缩小每个参数的规模可以将模型的内存占用减少80%以上使网络能够在更廉价的硬件上运行而输出质量不会出现明显下降。在架构层面专家混合设计在某些情况下正带来实质性的运营成本节省。与为每个查询都激活一个庞大、单一的神经网络不同专家混合模型将其参数划分为多个专门的子网络即专家。当用户提交查询时路由算法会判断哪个专家最适合处理该任务并只激活那条特定路径。例如如果用户提出一个编程问题只有编程相关的专家会被激活网络的大部分保持休眠状态。谷歌公司的研究人员估计专家混合技术可将计算量和数据传输量减少10到100倍。模型蒸馏技术使用一个庞大、高性能的模型作为教师训练出一个高效、精简的学生模型后者能以极低的成本执行特定任务。学生模型学习匹配教师模型详细的概率模式而非处理原始数据标签从而能够捕捉到大型模型更深层的推理逻辑和细微差别。微软公司研究员阿莱克西亚·乔利科尔-马蒂诺在小型递归模型方面进行了开创性工作这类模型在生物学和电气工程领域的复杂逻辑任务上取得了成功。她的研究表明高度结构化的小规模架构可以在不承担庞大基础模型开销的情况下解决定义明确的问题。并非每一项企业任务都需要用到最大或最强大的模型The Modern Data公司的库马尔表示。将模型与任务相匹配可以让更小或更专用的模型以更低的成本处理大量工作。GPU巨头英伟达公司估计目前多达70%的大语言模型查询可由小语言模型处理而不会造成性能的明显下降。国际数据公司的麦卡锡表示由于AI技术相对新颖各组织正艰难摸索如何高效使用这项技术并在此过程中浪费了大量资源。每当出现一波新技术浪潮我们都会看到人们不计成本地一拥而上他说。你并不总是需要最新、最强的GPU或模型。但组织缺乏足够的历史经验可供借鉴。一些能够带来最大效率提升的技术已经得到充分验证。检索增强生成技术通过提供上下文相关的信息来减少不必要的步骤。持久化内存使智能体能够复用之前的工作成果而无需从零开始重建上下文。这两者都是经过反复验证的技术能够削减处理开销。最大的效率提升来自于消除重复检索和重复推理同时不削弱所提供上下文的质量Yugabyte公司的马歇尔表示。上下文优化层也展现出良好前景。基于提示词中往往包含大量冗余信息这一假设内容优化技术在数据到达大语言模型之前就对其进行拦截和精简。开源项目Project Headroom在本地对繁重的数据负载进行预处理剥离语法样板代码隔离日志文件并用轻量级加密哈希值替代长文本流可在不影响准确性的前提下将Token消耗量减少高达95%。选择合适的模型同样能显著影响成本和能耗。答案不是减少使用AI而是更聪明地决定在哪里使用它为每个应用场景匹配合适的模型并构建高效的上下文管理和数据处理架构OutSystems公司产品管理高级总监贡萨洛·博雷加表示。灵活性至关重要。如果六个月后另一个模型能以更低成本完成同样的工作企业应该能够在不重建整个系统的情况下实现切换。用户还应考虑投资回报率。关键在于价值增长是否快于成本增长博雷加说。如果一个智能体能将两小时的流程缩短到三分钟那么为推理付费仍然能带来可观的回报。下一代基础设施尽管软件层面的优化有所帮助但要实现更大的效率提升更多还是取决于对物理基础设施和计算硬件的全面改造。这方面有前景的进展包括专用硅片架构、预测性内存管理、碳感知电网调度以及先进的热力学工程技术。一项重要的硬件举措是将处理任务从通用GPU转向专用集成电路和张量处理器。谷歌自主设计其张量处理器已有十多年历史该公司表示其Ironwood定制推理芯片的能效是其早期型号的30倍。科技巨头们也正将其数据中心机群转向直接液冷和液体浸没系统后者将服务器完全浸没在不导电的合成油中这种油能够导热但不导电。众多初创公司正重新思考软件与硬件的交互方式以消除处理瓶颈。成立两年的初创公司Mindbeam AI最近发布了一款开源推理框架据称可在普通消费级CPU上运行大语言模型在某些工作负载下完全绕过GPU瓶颈。Mindbeam的方法将神经网络权重限制为仅三个数值从而消除了会占用大量处理周期的复杂浮点乘法运算。该公司表示其方法可将CPU吞吐量提升17至96倍同时大幅削减内存消耗。Lightbits Labs、ScaleFlux公司和FarmGPU公司正合作开发一种架构以缓解因GPU内存有限而造成的AI推理瓶颈。LightInferra软件将键值缓存数据存储并复用于非易失性内存高速存储和托管GPU推理基础设施之间以预测数据何时被需要并将其提前移至处理器附近。Lightbits表示这一方案可将现有GPU的推理请求处理能力提升三倍同时将电力和基础设施成本削减65%。Lightbits Labs的Inferra是一种预测性预取算法它通过分析上下游信号来预测处理器接下来需要哪些数据并仅在需要时才流式传输细粒度的内存块。该公司将于9月9日发布Inferra表示该产品可将GPU利用率从平均10%到12%提升至超过75%同时使现有GPU基础设施能够支持多达16倍的并发推理会话。Groq公司已为一款名为语言处理单元的芯片设计筹集了6.5亿美元该芯片通过绕过GPU瓶颈来加速AI推理实现极高的Token生成速度。SambaNova公司已募集10亿美元用于打造一款推理芯片据称可将GPU处理速度提升多达五倍。Cerebras Systems公司希望通过一种晶圆级架构从英伟达公司手中夺取部分市场份额这种架构通过将模型权重保存在芯片内部内存中绕过了制约传统GPU的内存限制。该公司表示这种方法可将吞吐量提升500%。尽管有诸多举措试图取代GPU但由于其成熟的软件生态系统、灵活性以及支持快速变化模型的能力GPU仍保有重大优势高德纳公司杰出副总裁分析师阿伦·钱德拉塞卡兰表示。AI巨头们也正从静态电网消耗模式转向碳感知计算。英伟达声称在其最新的Vera Rubin平台中通过压缩AI模型在生成回复时用来判断每个单词或Token与其他Token关联强度的数值显著降低了GPU的功耗需求从而最大限度地减少不必要的计算和数据移动。其DSX MaxLPS框架能动态协调各机柜和工作负载间的功率限制使数据中心运营商能在相同的电力预算内多运行多达40%的GPU。以谷歌的碳智能计算管理系统为例它能自动分析次日的碳强度预测数据并生成调度方案在电网负荷高峰期限制可用于灵活后台工作负载的计算资源。前路展望尽管这些举措前景可期但它们最终可能会在杰文斯悖论的礁石上搁浅。英伟达在其最近一次财报公布中指出其增长正受到供应的制约这表明当前的需求几乎是无限的。更好的推理效率和硬件改进可以抵消部分电力需求的增长高德纳的钱德拉塞卡兰表示。然而更可能的结果是AI算力总需求持续增长即便每次提示或每项任务的成本和能耗持续下降。AI处理的复杂性也让简单的解决方案难以奏效。2024年末DeepSeek V3的发布就是一个例证。得益于算法优化该模型最终训练轮次的完成速度比同类模型快十倍电力和推理成本也相应大幅降低因此最初被誉为环保和经济层面的一项突破。然而据《经济学人》指出随着诸如DeepSeek R1这类推理模型的问世任何潜在的能源节省都被迅速抵消了。由于这些模型采用一种被称为二型思维的系统化方法——将问题分解、测试多种解决路径并在给出答案前进行验证——它们每次查询所需的处理时间大幅增加。V3带来的效率提升很快就被R1延长的思考时间吞噬殆尽。智能体也有类似的效应。由于它们能够搜索网络、编写代码并执行多步骤任务单次请求所消耗的能量比简单的聊天查询高出几个数量级。现有的度量框架尚未能够充分计入闲置机器开销、数据中心冷却以及网络传输带来的影响。这意味着AI的经济和环境成本很可能无法通过技术栈中的任何单一层面得到解决。提高效率需要一种协调一致的全栈方法将硬件设计、软件优化、数据管理和能源供应有机结合起来。唯有如此这个行业才能从过去那种依靠蛮力扩展的模式转变为一种高效、可持续的公共事业式运营模式。摆在我们面前的问题是随着AI使用规模的扩大我们能否将AI的边际成本降下来钱德拉塞卡兰说。我们目前还没有解决这个问题。QAQ1为什么AI比传统软件消耗更多的电力A因为AI的运行机制打破了传统软件的经济规律。传统软件只需编写一次代码新增用户的边际成本很低而AI推理需要为每次交互都执行真实的计算无法像传统软件那样通过缓存和代码复用来降低成本因此耗电量远高于传统计算。Q2数据中心到底消耗了多少电力和水资源A2023年数据中心用电量约占美国全部电力消耗的4.4%预计到2028年将增至三倍。全球数据中心用电量预计到2030年翻一番。一个大型数据中心每天可消耗高达500万加仑水相当于5万人口城市的用水量。Q3有哪些方法可以降低AI的能耗和成本A目前主要有量化技术压缩模型参数精度、专家混合架构只激活部分网络、模型蒸馏用小模型替代大模型完成特定任务、检索增强生成、专用芯片如TPU、液冷系统等多种技术手段可以在不明显降低性能的前提下大幅削减能耗和成本。