全球AI算力军备竞赛:从国产十万卡集群到马斯克Terafab的千亿豪赌

全球AI算力军备竞赛:从国产十万卡集群到马斯克Terafab的千亿豪赌

2026年,人工智能产业正在经历一场史无前例的"算力大爆炸"。如果说2023年至2025年是大模型算法的军备竞赛,那么2026年无疑已经进入了算力基础设施的决战时刻。从郑州到得州,从孟菲斯到路易斯安那,一座座史无前例的AI超级集群和芯片工厂正在以惊人的速度拔地而起。中科曙光宣布国内首个全国产十万卡AI超集群正式投运;马斯克将Terafab芯片工厂的总投资推高至1190亿美元;谷歌则为Anthropic编织了一张2000亿美元的芯片融资巨网。这些数字背后,是全球科技巨头对AI时代入场券的疯狂争夺,也是一场关乎未来十年科技产业格局的地缘战略博弈。

一、2026:全球AI算力投资进入"万亿级"狂飙时代

1.1 算力需求呈指数级膨胀

大模型的参数规模仍在以惊人的速度增长。从GPT-4的万亿级参数,到前沿模型向十万亿乃至百万亿参数迈进,训练所需的算力每三到六个月就要翻一番。推理侧的算力需求同样爆炸式增长——随着智能体(Agent)、多模态应用和实时交互场景的落地,全球数据中心的AI工作负载正在从训练为主转向训推并重。马斯克曾估算,全球现有芯片产能加起来,大约只够他旗下所有公司未来总需求的2%左右。这一判断虽然带有典型的"马斯克式夸张",但确实道出了整个产业的核心焦虑:算力供给远远落后于需求增长。

1.2 资本开支进入史无前例的量级

2026年,全球科技巨头的AI资本开支已经突破了传统意义上的"天文数字"。Meta宣布2026年AI基础设施总支出高达1450亿美元;OpenAI牵头的Stargate项目总规划投资5000亿美元;xAI的Colossus集群累计投资已达180亿美元。仅这几家公司的算力投资,就已经超过了许多国家的年度GDP。华尔街的金融机构也被卷入这场狂潮——私募信贷、基础设施基金、残值担保等金融工具被创造性地应用于AI芯片融资,谷歌与Anthropic的2000亿美元融资结构就是最具代表性的案例。

二、国产算力里程碑:曙光8000十万卡集群郑州投运

2.1 从万卡到十万卡的跨越

2026年7月10日,中科曙光在郑州宣布,中国首个全国产十万卡AI超集群——曙光8000(登峰)正式落成投用,并同步接入国家超算互联网郑州核心节点。这一事件标志着中国AI基础设施建设正式从万卡级迈向十万卡级部署阶段,具有里程碑式的意义。

曙光8000集群的峰值算力被形容为"相当于全人类持续计算200年"。这一比喻虽然抽象,但足以让人感受到其算力规模的震撼程度。更重要的是,该集群实现了从芯片、高速互联网络、分布式存储、散热运维到系统软件的全链条国产化打造,彻底摆脱了对海外技术的依赖。

2.2 全链路国产化的工程突破

建设十万卡级别的超大规模集群,远非简单的设备堆叠。超大集群运行时,网络传输卡顿、海量数据存储过载、设备散热耗能、算力统一调度等难题都会成倍增加,对整体架构设计和软硬件适配能力提出了极为严苛的考验。

曙光8000依靠本土研发体系,攻克了一系列大规模算力部署的工程难题。在互联网络层面,国产高速互联技术需要在十万个计算节点之间实现低延迟、高带宽的数据交换;在存储层面,需要支撑PB乃至EB级别的数据吞吐;在散热层面,如此规模的GPU集群产生的功耗和热量,对传统数据中心的设计理念构成了根本性挑战。该集群首创的"超智融合"运行模式,或许正是应对这些挑战的关键创新。

2.3 为什么选择郑州

全国首个十万卡AI算力中心落户郑州,背后有着深层的战略考量。郑州作为国家超算互联网的核心节点之一,具备得天独厚的地理和能源优势。中原地区相对凉爽的气候有助于降低散热成本,而全国一体化算力网络的布局,则让郑州成为连接东西部算力资源的枢纽节点。曙光8000的投运,不仅将大幅提升华中地区的AI算力供给能力,更将为中国的大模型训练、科学智能和智能体应用提供普惠、高效、便捷的国产算力服务。

三、马斯克Terafab:1190亿美元挑战芯片产业格局

3.1 从168亿到1190亿的超级芯片工厂

2026年8月6日,得州州长亲自官宣:SpaceX与特斯拉联合打造的超级芯片工厂项目Terafab,正式落户德克萨斯州格莱姆斯县,紧邻吉本斯溪水库旧址。首期投资168亿美元,厂房面积达1亿平方英尺。而按照此前披露的申报文件,如果分期全部落地,总投资可能攀升至1190亿美元。

1190亿美元是什么概念?英特尔俄亥俄工厂和台积电亚利桑那工厂的规划产能加在一起,都未必能达到Terafab的目标规模。这座工厂的目标是每年制造1000亿至2000亿颗先进的2纳米芯片,实现年产能1太瓦(1万亿瓦)AI算力。这不仅是一座芯片工厂,更是马斯克要同时对英伟达、台积电、ASML等传统半导体巨头发起的正面挑战。

3.2 垂直整合的野心

Terafab的定位是一座垂直整合的半导体综合体,涵盖芯片设计、推理和存储芯片制造、封装与测试全流程,并配备所有必要设备。这意味着马斯克不满足于仅仅设计芯片然后交给台积电代工——他要掌控从硅片到成品的完整链条。

这一布局与马斯克旗下公司的需求高度契合。特斯拉的FSD自动驾驶需要定制AI芯片,Optimus人形机器人需要边缘推理芯片,xAI的大模型训练需要海量GPU,SpaceX的星链和太空数据中心也需要专属算力支撑。马斯克本人估算,仅他旗下公司的芯片需求,就已经超过了全球现有产能的承受范围。

3.3 地缘政治与供应链安全的考量

Terafab的落地也带有浓厚的地缘政治色彩。在中美科技竞争加剧、台积电亚利桑那工厂进展缓慢、先进制程芯片出口管制趋严的背景下,美国本土的先进芯片制造能力成为战略优先级最高的产业议题之一。马斯克选择在德州建设Terafab,既是对供应链安全的一种押注,也是在争夺美国政府和产业界对本土半导体制造的支持资源。

四、谷歌的2000亿美元融资巨网:华尔街如何为AI芯片买单

4.1 史上最大规模的基础设施融资

2026年8月,英国《金融时报》披露了谷歌为Anthropic搭建的史上最大规模基础设施融资计划。这项计划捆绑了约2000亿美元的合约,谷歌将向Anthropic出售逾1500亿美元的人工智能芯片——主要是谷歌自研的TPU(张量处理单元)。

这一融资结构的复杂程度和规模,在科技产业史上都极为罕见。它不仅是简单的"卖芯片",而是一个涉及多方金融机构、多层风险分配、多种金融工具的精密资本运作。

4.2 融资结构的拆解

这场资本运作的核心参与方包括:

  • 谷歌:作为芯片供应方和整个融资架构的设计者,通过向Anthropic出售TPU来锁定长期收入。

  • 博通(Broadcom):与谷歌共同开发TPU,并为约300亿美元的融资提供残值担保(residual-value guarantee)。这意味着如果Anthropic停止支付,博通将承担资产价值缩水的风险。同时,博通自身也有巨额的采购承诺——2027财年高达552亿美元,后续更是达到720亿美元。

  • 阿波罗全球管理(Apollo):作为私募信贷的牵头方,在第一批次中发挥了关键作用。

  • 黑石集团(Blackstone):作为重要的基础设施投资参与方。

  • 摩根士丹利(Morgan Stanley):作为主要的投行和融资安排方。
  • 第一批次的35亿美元私募信贷已于2026年6月完成。这个融资网络还延伸至一系列加密货币挖矿公司,它们通过数据中心的后备安排被纳入整个生态系统。

    4.3 风险与创新的双重性

    Anthropic目前尚无信用评级,也尚未证明其有能力产生覆盖如此规模硬件投资的现金流。然而,它却被赋予了数十亿美元的TPU使用权。这种"先给算力、后验证商业模式"的做法,充分体现了当前AI产业的独特逻辑:算力即权力,拥有最先进的训练集群,就拥有定义下一代AI模型的能力。

    从金融创新的角度看,这套融资架构将传统的设备融资、私募信贷、资产担保、长期供应协议等工具创造性地组合在一起,为AI基础设施的大规模资本化探索出了一条新路。但从风险角度看,如果AI模型的商业化进展不及预期,这张巨网中的每一个环节都可能面临连锁反应。

    五、英伟达SCADA与开源cuFile:存储成为AI新战场

    5.1 当存储成为算力瓶颈

    随着GPU集群规模从万卡扩展到十万卡乃至百万卡级别,存储系统正在成为新的性能瓶颈。传统的CPU中介式I/O架构无法满足AI工作负载的需求——训练时需要高速读取海量数据集,推理时需要低延迟访问KV缓存,而CPU在处理这些请求时已经成为整个系统的短板。

    英伟达在2026年正式推出了SCADA框架和开源cuFile API,标志着存储控制权的根本转移:从CPU到GPU。

    5.2 SCADA:将存储控制放到GPU上

    SCADA全称Scaled, Accelerated Data Access(规模化加速数据访问),其核心理念是将存储控制逻辑直接移到GPU上。在传统架构中,GPU需要等待CPU从存储中读取数据后再进行计算;而在SCADA架构下,大规模并行的GPU可以直接从存储中提取所需数据,加载到自己的高带宽内存中。

    cuFile是NVIDIA GPUDirect Storage的开源组件,它使用数十万个GPU线程、快速的高带宽内存和其他优化方法,能够在短短几微秒内安全地从存储中访问数据。英伟达将cuFile API及其完整的垂直存储软件栈开源,并在GitHub上成立了新的XIO-SIG组织,创始维护者包括谷歌、英特尔、Meta和英伟达自身。

    5.3 Storage-Next生态

    英伟达还正式启动了Storage-Next计划,该计划自GTC 2025年起就开始公开讨论,如今已有超过40家存储和闪存厂商参与,包括DDN、KIOXIA和Micron等。这些参与者正在协作定义当GPU而非CPU成为存储客户端时,存储设备应当如何响应。

    这一变革的驱动力来自KV缓存的经济学:推理时每次数据获取可能只有几百字节,而SSD的块大小通常是4KB甚至更大。SCADA架构让GPU能够以更细的粒度、更高的并行度访问存储,从而大幅提升推理效率和降低总体拥有成本。在十万卡乃至百万卡集群中,存储效率的提升意味着数亿美元级别的成本差异。

    六、国际AI集群横向对比:谁拥有最强算力

    2026年的全球AI算力版图呈现出前所未有的多样性。从美国到中国,从科技巨头到初创公司,一场基于超大规模集群的"算力排位赛"正在激烈进行。

    6.1 主要AI训练集群参数对比

    | 集群名称 | 所属公司 | 地点 | GPU/加速卡数量 | 总算力/功耗 | 投资规模 | 核心用途 |
    |---------|---------|------|--------------|------------|---------|---------|
    | 曙光8000(登峰) | 中科曙光 | 中国郑州 | 10万卡(国产) | 峰值算力等效人类计算200年 | 未披露(预估百亿级人民币) | 国产大模型训练、科学智能 |
    | Colossus 2 | xAI | 美国孟菲斯 | 55.5万块GPU | 2 GW | 约180亿美元 | Grok系列模型训练 |
    | Prometheus | Meta | 美国俄亥俄州 | 未披露(1 GW级) | 1 GW | 约100亿美元 | Llama 4训练 |
    | Hyperion | Meta | 美国路易斯安那州 | 未披露(规划5 GW) | 规划5 GW | 500亿美元+ | Llama 5及空间AI |
    | Stargate(多园区) | OpenAI/Oracle/软银 | 德州、新墨西哥、俄亥俄等 | 超200万颗GB200 | 全美总容量近7 GW | 总规划5000亿美元 | 下一代AGI研发 |
    | Google TPU集群 | 谷歌 | 美国多地 | 1500亿美元TPU | 未披露 | 2000亿美元融资计划 | Anthropic Claude训练 |

    6.2 各集群的技术路线差异

    xAI的Colossus集群是全球首个单体算力达到吉瓦级别的AI训练集群,它在短短122天内建成首期,随后迅速扩展至55.5万块GPU。其网络架构采用了NVIDIA Spectrum-X以太网平台,证明了标准以太网在超大规模AI集群中的可行性。

    Meta则采用了xAI验证过的"帐篷式"预制架构,以打破传统数据中心漫长的建设周期。其俄亥俄州的Prometheus集群专注于训练Llama 4,而路易斯安那州的Hyperion则瞄准了5GW的终极目标,将成为训练Llama 5和实时空间AI的核心引擎。Meta还在推进自研Iris芯片(MTIA),计划在2026年9月进入量产,以降低对英伟达的依赖。

    OpenAI的Stargate项目规模最为宏大,总规划投资5000亿美元,全美总开发容量已突破5GW。2026年6月,Stargate在密歇根州Saline Township举行了160亿美元园区的奠基仪式。不过,该项目也面临挑战——OpenAI已暂停了英国Stargate项目,理由是能源成本和监管担忧。

    七、投资规模与时间线:一场千亿级别的赛跑

    7.1 主要AI算力投资项目规模对比

    | 项目名称 | 主导方 | 总投资规模 | 首期/已落地投资 | 目标产能/规模 | 预计全面投产时间 |
    |---------|--------|----------|--------------|-------------|---------------|
    | Terafab | 马斯克(SpaceX/特斯拉/xAI) | 1190亿美元 | 168亿美元 | 年产1太瓦算力、千亿级2nm芯片 | 2029年(首期) |
    | Stargate | OpenAI/Oracle/软银/MGX | 5000亿美元 | 160亿美元(密歇根园区) | 全美10GW+算力网络 | 2028-2030年 |
    | Hyperion | Meta | 500亿美元+ | 逐步投入 | 5GW算力集群 | 2027-2028年 |
    | Colossus | xAI | 180亿美元 | 已建成2GW | 55.5万块GPU、2GW | 已投运,持续扩建 |
    | 曙光8000 | 中科曙光 | 未披露 | 已投运 | 10万卡国产AI集群 | 2026年7月已投运 |
    | Google-Anthropic TPU | 谷歌/Anthropic | 2000亿美元(融资计划) | 35亿美元(第一批次) | 1500亿美元TPU供应 | 持续交付 |

    7.2 关键事件时间线

    | 时间 | 事件 |
    |------|------|
    | 2024年12月 | Meta首次宣布Hyperion项目(当时规划2GW/100亿美元) |
    | 2025年 | xAI Colossus首期在孟菲斯建成,规模达10万块GPU |
    | 2026年1月 | xAI Colossus 2正式投运,全球首个GW级AI训练集群;集群扩展至55.5万块GPU |
    | 2026年3月 | 马斯克首次发布Terafab项目,目标年产1太瓦算力 |
    | 2026年6月 | Google-Anthropic 2000亿美元融资计划第一批次35亿美元完成;Stargate密歇根园区奠基 |
    | 2026年7月 | Meta宣布Hyperion扩容至5GW/500亿美元+;中科曙光8000十万卡集群在郑州正式投运 |
    | 2026年8月 | Terafab正式落户德州格莱姆斯县,首期168亿美元;Google-Anthropic融资计划细节全面披露 |

    八、产业影响与地缘战略分析

    8.1 半导体产业链的权力重构

    Terafab的1190亿美元投资如果按计划推进,将从根本上改变全球半导体制造的权力结构。目前,台积电在全球先进制程芯片代工市场的份额超过90%,而Terafab的目标是建立完全不依赖外部代工的本土产能。如果成功,美国将首次在本土拥有与台积电、三星相抗衡的先进芯片制造能力。

    谷歌与博通的TPU合作模式则代表了另一种权力重构路径:通过自研ASIC芯片和定制化融资,云厂商正在试图打破英伟达在AI芯片领域的一家独大。博通作为TPU的共同开发者,2027财年的相关采购承诺高达552亿美元,这意味着定制化AI芯片的市场规模正在快速逼近通用GPU。

    8.2 中美算力竞争的"平行体系"

    曙光8000的全链路国产化,标志着中国正在构建一套与美国平行的AI算力体系。从芯片(华为昇腾、寒武纪、海光等)到互联网络(国产RoCE/InfiniBand替代方案),再到存储和系统软件,中国正在以"去美化"为目标,打造完整的自主可控产业链。

    这种"平行体系"的形成具有深远影响。一方面,它降低了中国AI产业对外部供应链中断的脆弱性;另一方面,它也可能导致全球AI生态的分裂——不同的技术栈、不同的软件框架、不同的硬件标准。对于依赖全球协作的开源社区和学术研究而言,这种分裂将带来长期的不确定性。

    8.3 "算力主权"成为国家战略核心

    2026年的算力竞赛已经超越了商业竞争的范畴,演变为国家战略层面的"算力主权"之争。欧盟、英国、日本、沙特等国家和地区都在加速本土AI基础设施的建设。沙特阿拉伯的Public Investment Fund(PIF)通过MGX参与了Stargate项目;英国虽然被OpenAI暂停了Stargate计划,但仍在推进本国的AI算力中心建设。

    算力正在成为21世纪最重要的战略资源之一,其地位堪比20世纪的石油和钢铁。拥有算力,就拥有训练最前沿AI模型的能力;拥有最前沿的AI模型,就拥有在军事、经济、科技各领域的主导权。这一逻辑正在驱动各国政府以前所未有的力度介入AI基础设施建设。

    九、风险与挑战:狂欢背后的阴影

    9.1 产能过剩的隐忧

    当Meta将Hyperion的投资从100亿美元上调至500亿美元以上,当OpenAI规划5000亿美元的Stargate网络,当马斯克喊出1190亿美元的Terafab,一个无法回避的问题是:这些算力真的都能被有效利用吗?

    AI模型的训练效率正在快速提升。MoE(混合专家)架构、蒸馏技术、推理时计算扩展等新方法,使得达到同等智能水平所需的训练算力在下降。与此同时,前沿模型的数量是有限的——全球可能只需要少数几个万亿参数级别的基座模型。如果训练需求的增长放缓,而算力供给以万亿级美元的速度扩张,产能过剩的风险将迅速积累。

    9.2 能源与可持续性的硬约束

    一个GW级别的AI集群每年消耗的电力,相当于一座中等城市的总用电量。xAI Colossus的2GW、Meta Hyperion规划的5GW、Stargate全美的10GW+——这些数字累加起来,将对美国的电网造成巨大压力。OpenAI已经因为能源成本问题暂停了英国的Stargate项目。

    数据中心的水资源消耗同样触目惊心。用于冷却的淡水在大量蒸发,对当地生态系统造成压力。在气候变化和ESG(环境、社会与治理)投资标准日益严格的背景下,算力扩张的可持续性将面临越来越多的质疑。

    9.3 供应链安全与地缘政治风险

    即便投资规模再大,芯片制造的核心设备——ASML的EUV光刻机——仍然掌握在极少数供应商手中。Terafab要实现2纳米量产,仍然需要解决光刻机等关键设备的获取问题。在中美科技博弈的大背景下,任何涉及先进制程的供应链都可能成为制裁和反制裁的对象。

    此外,Anthropic的2000亿美元融资计划虽然创新,但也蕴含金融风险。一家尚未盈利的AI初创公司,通过复杂的金融工具锁定数千亿美元的芯片供应,如果AI的商业化落地速度慢于预期,这套融资架构的可持续性将面临严峻考验。

    9.4 技术人才短缺

    建设十万卡集群是一回事,让它高效运转是另一回事。全球范围内,能够设计、部署和优化超大规模AI集群的工程师极度稀缺。从网络拓扑设计到分布式训练框架调优,从散热工程到电力管理,每一个环节都需要顶尖的跨学科人才。算力投资的增长速度,可能已经超过了人才培养的速度。

    十、结语:算力即权力,但权力需要智慧驾驭

    2026年的全球AI算力竞赛,是一幅波澜壮阔却又令人眩晕的科技图景。郑州的曙光8000代表着国产算力从跟跑到并行的坚定步伐;得州的Terafab彰显着马斯克改写半导体产业规则的野心;谷歌2000亿美元的融资巨网展示了华尔街与硅谷联手制造算力的金融创新能力;英伟达的SCADA和开源cuFile则预示着存储架构的根本性变革。

    然而,在这场千亿级别的算力狂欢中,我们也需要保持清醒。算力的价值最终取决于它创造了什么——是更智能的AI助手、更高效的科学研究、更普惠的医疗服务,还是仅仅是更大参数的模型和更烧钱的军备竞赛?当各国、各公司为争夺算力主权而投入天文数字的资源时,如何确保这些投资最终转化为人类福祉,而非新的不平等和冲突源,将是比建设任何超级集群都更艰巨的课题。

    算力即权力,但权力需要智慧驾驭。2026年的算力军备竞赛,或许正在定义未来数十年的科技版图,但它的最终结局,仍然掌握在那些能够最智慧地运用算力的人手中。

    💬 评论区 (0)

    暂无评论,快来抢沙发吧!