硅谷为何渴求算力:从 Agent 需求到 2027 年供给周期

 

前置阅读:DualPath:用双路径 KV-Cache 加载打破 Agentic 推理的存储瓶颈 · NVL72 架构解析:72 GPU 全互连拓扑

为什么一边是数据中心不断扩建,另一边却还是“没有足够的算力”?如果今天真的这么缺,2027 年又怎么可能出现过剩?

Asianometry 在 《Silicon Valley’s Starving for Compute》 中,记录了参加 Hot Chips 2026、走访美国湾区和 SEMICON Taiwan 后的观察。他看到推理芯片的新机会、越来越大的封装,也听到模型团队四处找 GPU 的故事。

与此同时,供应链已经全力扩张,未来的收入能否撑住这么多新增容量,也成了必须回答的问题。[1]

用户调用模型的方式变了,硬件供给却要经过设计、制造、封装和机房交付;当两条曲线的时间节奏不同,短缺和过剩就可能先后发生。

下文结合论文、厂商资料和原始访谈展开这些问题。市场见闻来自这次走访,2027 年的数字用于情景推演;资料核对截至 2026 年 10 月 4 日。

1 从聊天问答到 AI Agent

早期聊天产品的典型交互是:用户提问,模型生成一段答案,调用结束。

Coding Agent 的交互则长得多。它可能先读代码,再修改文件、运行测试、分析报错,然后继续修改;一个用户请求会展开成多轮模型调用和工具操作。

需求的变化主要体现在任务内部:同一个任务会调用多少轮模型、上下文有多长、是否并行探索多个方案,都会影响资源消耗。只统计“每天有多少次用户提问”,已经很难描述实际负载。

资源压力也不只来自计算。DualPath 研究多轮 Agent 推理中的 KV-Cache 加载:在它分析的分离式系统里,Prefill 侧存储网卡饱和,Decode 侧对应资源却闲置,系统吞吐受到 I/O 限制。[3] Agent 任务增长,可能同时增加计算、存储和网络负载。

随着这类长时间运行的 AI Agent 任务增多,湾区企业也开始争相锁定算力。

Anthropic 在 2026 年 5 月的官方公告中披露,取得 Colossus 1 的全部算力,并新增超过 300 MW、超过 22 万张 NVIDIA GPU,同时提高部分 Claude 产品的使用上限。[4]

2 推理需求扩大,新的 AI 芯片机会

推理需求的增长,也让专用 AI 芯片有了新的机会。Etched、MatX、Positron、Fractile 等公司的路线,需要放在训练与推理需求分化的背景下看。[1,03:03–04:00]

训练侧关心大规模计算能否高效完成;面向用户的推理,还要处理等待时间、请求分布、上下文和服务成本。这些约束给芯片设计带来了不同的取舍:计算能力要与内存、网络和服务方式一起优化。

OpenAI 与 Broadcom 公布的 Jalapeño 就体现了这一方向:官方资料把模型、kernel、内存、网络和 serving 模式一起作为设计输入,目标是面向 LLM 推理协同优化。其首次部署计划于 2026 年底开始。[5]

3 单颗裸片做不大,就把集成范围继续扩大

芯片设计之外,制造生态也在围绕新的需求调整。SEMICON Taiwan 上,台积电虽然没有展位,团队仍在走访供应商,高管也在论坛提出技术问题。这些需求沿着供应链传递,推动材料和设备厂商寻找解决方案。[1,05:58–06:37]

其中一个直接的需求,就是扩大集成范围。单颗逻辑裸片的尺寸受光刻曝光场约束,而 AI 系统还希望放入更多计算部件和内存。先进封装提供了一条路径:在更大的中介层和封装中连接多个裸片与 HBM。[6][7]

CoWoS 尺寸扩展路线图

台积电 CoWoS 尺寸路线图,取帧时间 07:08;对应讲解区间 06:53–07:10。

图中的 reticle 倍数描述中介层等封装集成尺度,不能读成一颗单体逻辑裸片的面积。

台积电 2026 年技术论坛资料表示,5.5-reticle CoWoS 已投入生产;14-reticle、约 10 个大型计算裸片和 20 个 HBM 堆栈,则是 2028 年的目标。[6]

封装尺寸扩大后,材料和加工设备也要跟着变化。玻璃面板等方案需要配套的加工与搬运设备,还要稳定解决翘曲、裂纹等问题。展会上已经出现适配方形面板的搬运设备,说明设备端的准备也在推进。[1,07:10–08:07]

方形面板搬运设备

4 算力紧缺,对不同公司意味着什么

同一轮短缺,会给不同公司带来截然不同的处境:有人兴奋地筹建新的算力公司,也有人拿着融资,却担心训练迟迟无法开始。

4.1 Neocloud:客户急着买,交付压力也在增加

Neocloud 是以 AI 训练和推理基础设施为主要业务的云提供商,CoreWeave、Nebius 就属于这一类。客户购买的不只是 GPU 计算,还包括集群网络、存储和作业运行环境。CoreWeave 提供 GPU 实例、InfiniBand / Ethernet 网络以及 Kubernetes / Slurm 等服务;Nebius 同样面向训练和推理,提供 GPU 与 InfiniBand 等基础设施。[11][12]

算力短缺有利于这些公司。一家已经有可用集群的供应商,面对的是急于启动作业的客户:客户在意价格,也在意是否有足够的容量、何时能开始、能连续使用多久。

模型团队如果担心下个月租不到资源,就更有动机提前预订,并承诺更长的使用期限。对供应商而言,这有利于锁定客户需求、安排扩建,也降低了新容量上线后无人使用的不确定性。

受访的算力供应商对当时的市场相当乐观:可即时购买的现货算力已经很难找到,一些经营者预计短缺至少还会持续一至两年,也有人正在筹建新的 neocloud。[1,08:41–09:18]

不过,客户愿意签约与供应商能完成交付之间,还隔着硬件、供电、机房和集群调试。已经上线的容量可以接单,一家刚成立的公司仍要解决这些建设问题。

扩张也会先消耗资金,而租金收入要等资源交给客户后才能逐步产生。因此,短缺提供了销售机会,却同时考验建设能力和融资安排。

更大的风险来自时间差:公司根据今天的高需求建设机房,设备可能在一两年后才大批投入运营。到那时,竞争者也可能已经完成扩建,客户未必继续接受今天的租价。

今天的短缺与未来的供给周期,也就在这里连了起来:眼前容易卖出去的容量,并不能替未来全部新增容量保证同样的回报。

4.2 模型创业公司:训练排期会传到产品和融资

站在购买算力的一侧,短缺首先表现为研发时间被拖长。

对依赖训练自有模型的创业公司,一轮实验需要的资源没到位,就无法按计划验证假设;实验结果没有出来,下一轮模型改进、评测和产品发布也要跟着调整。

与此同时,团队的工资和其他固定支出仍在发生。相同的一笔融资能够支持的时间有限,等待算力也会消耗这段时间。

设想一家创业公司因为缺少算力,产品要拖到 2027 年中才能推出。这就不再只是技术团队的排期问题,也会影响投资人的预期。基础设施短缺,由此直接变成经营风险。[1,09:20–09:31]

投资人的支持也开始延伸到寻找生产资源。走访中有这样的故事:VC 为已投公司四处寻找成批 GPU,追着“一千张卡”的资源跑,甚至去东欧找算力。[1,09:35–09:48]

4.3 大型实验室:资源优势会扩大

与四处寻找训练资源的创业团队相比,OpenAI、Anthropic 有能力安排大规模采购和长期合作。

Anthropic 前文提到的 SpaceX 合作就是具体例子,它取得 Colossus 1 的全部算力,新增超过 300 MW 和超过 22 万张 GPU。[4]

Dylan Patel 在 2026 年 8 月的访谈中预计,到 2026 年底,OpenAI 和 Anthropic 各自会超过 5 GW。这个年末预测包含租用资源,指的是它们能够取得的容量,而非当时已经拥有的自建机房规模。[9]

GW 描述供电规模,1 GW 等于 1000 MW。粗略换成 GPU 卡数,可以这样理解:

供电规模 H200 B300
1 GW 约 60 万张 约 40 万张
5 GW 约 300 万张 约 200 万张

按园区总功率估算,假设预留 25% 给冷却和外部配套设施,再按 NVIDIA 整机功耗折算。[15][16]

资源集中的经济逻辑也比较直接:如果一家实验室能用模型服务获得较高收入,它就可能承受更高的算力采购价格,并把部分收入继续投入训练。[9] 稳定的产品需求增加了提前锁定容量的动力,规模更大的采购又可能帮助它获得后续资源。

商业化能力由此影响下一轮研究资源的分配,而资源充足又为更多实验创造条件。这是一个可能自我强化的过程,实际效果取决于收入能否持续、采购成本以及研究成果。

4.4 Neolab:为什么没有短期收入,也有人愿意资助研究

训练资源越来越昂贵,成熟实验室又能提前锁定大量容量。探索不同技术路线,也需要稳定的资金和算力,以及愿意承担早期风险的支持者。Neolab,也就是以研究探索为主要目标的创业实验室,尝试为这些方向争取资源。[1,11:39–11:56]

Neolab 与 neocloud 的业务不同。Neocloud 把基础设施交付给客户,依靠客户使用资源获得收入;neolab 把资金和算力投入未知的研究问题,希望产生新的能力、结构或方法。它们常由有经验的研究者创办,融资依据可以是团队与研究方向,近期收入和产品计划则未必已经清晰。

这个称呼的边界比较模糊。Safe Superintelligence(SSI)专注于研究安全的超级智能,并强调让研究免于短期商业压力。[13] Sakana AI、Thinking Machines 和 Reflection AI 则说明,研究型公司也可以有产品;Physical Intelligence、Periodic Labs、Generalist AI 等例子,又把范围扩展到材料科学、世界模型和机器人。共同点是研究探索在组织目标中占据重要位置,而非所有公司都没有收入或产品。[1,11:57–12:37]

这类融资的核心问题,是尚未成熟的研究由谁承担。大学、政府实验室或 Bell Labs 一类机构,曾为从科学探索走向商业应用提供组织支持。当更多前沿 AI 人才与资源集中在产业内部,neolab 提供了另一种可能:让尚未进入成熟产品计划的方向,也能获得持续探索的机会。[1,12:40–13:23]

一种投资思路,是由 NVIDIA 与 VC 等掌握资金和算力的参与者,支持多条不确定性很高的路线。对 OpenAI、Anthropic 这类已经围绕 Transformer 路线积累大量投入的实验室,继续优化既有路线可能更有吸引力;新实验室则可以把主要精力放在尚未得到充分验证的想法上。不同组织的研究优先级,由此可能为新路线留出机会。[1,13:23–13:40]

这种押注看重的是少数突破可能带来的巨大价值。例如,一种更节省数据的新架构,如果能在重要任务上达到足够好的效果,并显著改善现有方法的成本或能力,大实验室就可能有采用它的动力。发现者即使还没有成熟的销售业务,也可能凭借技术、人才和实现经验成为收购对象。一项足够重要的发现,有机会通过收购让前期研究投入得到回报,这正是高风险研究投资的吸引力所在。[1,13:44–14:01]

这条推理也指出了研究型公司的难点。新想法需要先变成可重复的实验结果,再证明它在扩大规模或迁移到实际任务后仍有优势,最后才谈得上被采用。一个小规模演示与能够改变巨头技术路线的成果之间,还有很长的距离。

研究方向即使追求更高的数据效率,也仍要用算力开展实验、比较基线和验证结果。资助可以采用提供算力的形式,但用于探索的资源,也可以用于服务付费客户或支持其他实验。投入形式改变了,失败的代价并没有消失。对 neolab 而言,短缺会限制实验;对资助方而言,问题是愿意拿出多少稀缺资源,支持一个可能失败、但有机会改变技术路线的方向。

与继续增加股票回购相比,把一部分现金流投入探索性研究,能够为尚未成熟的技术路线留下试错空间。这也是高风险研究投资值得关注的原因。[1,14:02–14:16]

5 token 用得更多,客户是否更划算

算力用得更多,最终客户获得的价值是否也增加了?湾区访谈中已经出现大量使用案例,整体回报却还缺少清晰的测量。一个具体案例是金融机构的报表工作:两位年轻分析师配合 Claude 编写仪表盘,完成过去需要更多报表分析师参与的任务。[1,14:26–15:03]

要评价这类工作流,除了生成速度,还要看业务人员是否减少等待、错误是否更少、维护和审查增加了多少,以及节省的人力被投入到哪里。这些变化共同决定了实际回报。

OpenAI 的研究代理用量图,提供了另一个观察角度。

OpenAI 内部研究代理用量图

两张研究代理使用量图,取帧时间 15:43;对应讲解区间 15:18–15:42,选帧在区间末尾之后约 1 秒,用于获取完整稳定画面。左图为中位数研究者,右图为第 90 百分位研究者。

纵轴是按 API 价格计量的每日推理用量,两个图的刻度不同。OpenAI 披露的代理能够在人类指导下执行明确的研究任务,研究优先级、结果判断和后续行动仍由人来把握。[8] 使用额上升说明工具被更多地采用,但要评价科研产出和成本节省,还需要观察任务结果。

工程上可以用更接近结果的指标补充 token 账单:

\[c_{\mathrm{success}} = \frac{C_{\mathrm{model}} + C_{\mathrm{tools}} + C_{\mathrm{review}}}{N_{\mathrm{accepted}}}.\]

$C_{\mathrm{model}}$ 是一批任务的模型费用,包含失败与重试;$C_{\mathrm{tools}}$ 是工具执行等其他费用;$C_{\mathrm{review}}$ 是按统一方式折算的人工复核成本;$N_{\mathrm{accepted}}$ 是最终通过验收的任务数。分母为零时,不能报告一个有限的“每成功任务成本”。这个定义只是把账摊到可用结果上,业务收益仍要另行测量。

实际记录时,可以给每个任务保存完成状态、调用轮次、输入与输出 token、工具耗时、人工复核分钟数、重试次数和费用,并固定验收标准。这样才知道更高的并发是在增加有效吞吐,还是主要增加失败结果和待审查内容。

单项任务变得便宜,也可能让团队开展更多项目和实验。任务效率提高与总工作量增长可以同时发生:人们做事更快了,却也开始做过去没有时间做的事,AI 用量因而继续增长。

6 把 2027 年的账按单位和时间重算一遍

如果供应链逐步追上需求,新增容量需要多大的收入来支撑?可以先用一组估计和假设,做一次 2027 年供给情景推演:[1,15:58–17:26]

输入 情景数值 口径
2026 年底可用 AI 数据中心容量 15 GW 情景估计
2027 年底容量 45–55 GW 前瞻估计,非已交付容量
两家大型实验室的合计容量 30 GW 推演输入,口述的存量/增量范围未完全澄清
用于推理的比例 50% 假设
每 GW 推理的年收入密度 500 亿–1000 亿美元 分析师估计与较乐观情景

这组总量作为情景输入,尚缺同口径的一手数据支持。Dylan Patel 的访谈讨论了单位功率收入与算力集中,但全球新增容量、实验室取得的容量和年底总量,需要分别看待。[9]

按这组输入,两家实验室用于推理的容量是:

\[P_{\mathrm{inf}} = 30\ \mathrm{GW}\times 50\% = 15\ \mathrm{GW}.\]

再乘单位收入密度 $q$:

\[R_{\mathrm{run}} = P_{\mathrm{inf}}q = 15\times(50\text{–}100) = 750\text{–}1500\ \mathrm{billion\ USD/year}.\]

这里 $q$ 以十亿美元/GW/年计量,结果为每年 7500 亿至 1.5 万亿美元。$R_{\mathrm{run}}$ 描述这部分容量充分运行时的年化收入规模。要维持这一量级,需要相应规模的付费需求;如果需求增长跟不上供给,单位容量收入和租价就可能下降。

从基础设施侧看,假设容量为 40 GW、租金为每 MW 每年 2000 万美元,会得到每年 8000 亿美元的付款规模。原始租价的时间单位未明确,这里统一按年度口径计算:

\[L = 40\ \mathrm{GW}\times1000\ \mathrm{MW/GW} \times20\ \mathrm{million\ USD/(MW\cdot year)} =800\ \mathrm{billion\ USD/year}.\]

$L$ 是该假设下租户的付款,对应供给商的租金收入;供给商利润还需扣除运营、折旧和融资成本。它覆盖的基础设施范围与两家公司的业务营收范围不同,两个结果不能直接相减来判断谁会亏多少。

单位功率收入还不能直接从算力租金推出来。Anthropic 5 月公告披露的是 Colossus 1、超过 300 MW 与超过 22 万 GPU;SpaceX 6 月招股书披露的每月 12.5 亿美元,则覆盖 Colossus 和 Colossus II、约 32.5 万 GPU 及其他服务。[4][10] 两份披露范围不同,不能直接用月费除以 300 MW。即使范围能够对应,租赁支付首先也是模型公司的成本,它能产生多少终端收入,还要看实际业务。

投产时间同样会改变结果。如果一批新增容量在下半年才上线,当年贡献收入的时间最多只有半年。年底容量乘年收入密度,得到的年化值,不能直接当作这一年的确认收入。

把投产时点放回来,全年收入应写成:

\[R_{2027} = \int_0^1 P_{\mathrm{inf}}(t)\,u(t)\,q(t)\,\mathrm dt.\]

$t$ 从年初的 0 走到年末的 1,以年计量;$P_{\mathrm{inf}}(t)$ 是当时已上线的推理容量;$u(t)$ 是可以变现的有效利用率;$q(t)$ 是另行假设的满有效利用时单位容量年收入密度。使用收入密度时,需要先确认它是否已经计入利用率;若已计入,就不应再额外乘一次 $u(t)$。下面取 500 亿美元作为满有效利用时的教学参数,不直接套用口径尚未澄清的访谈数字。

例如,假设这部分 15 GW 在 7 月才一次性全部上线,上半年为零,下半年满利用,满利用收入密度固定为每 GW 每年 500 亿美元。那么当年收入是 3750 亿美元,年底的年化规模仍是 7500 亿美元。这个算例展示了投产时间对全年收入的影响。

可以用一个小脚本把投产月份、利用率和假设收入密度分开改变。下面按整月运行、忽略月份天数差异,只算这部分假设容量:

# q_billion: assumed revenue density at full effective utilization
# Units: billion USD / GW / year
# start_month: first fully operating month, 1 through 12

def revenue(gw, start_month, utilization, q_billion):
    if not 1 <= start_month <= 12:
        raise ValueError("start_month must be between 1 and 12")
    if not 0 <= utilization <= 1 or gw < 0 or q_billion < 0:
        raise ValueError("invalid capacity, utilization, or price")
    active_months = 13 - start_month
    annualized = gw * utilization * q_billion
    return annualized * active_months / 12, annualized

scenarios = [
    ("January, full use", 15, 1, 1.0, 50),
    ("July, full use", 15, 7, 1.0, 50),
    ("July, lower use", 15, 7, 0.7, 50),
    ("July, lower use and revenue density", 15, 7, 0.7, 30),
]
for name, gw, month, use, q in scenarios:
    realized, run_rate = revenue(gw, month, use, q)
    print(f"{name}: realized={realized:.1f}B, run_rate={run_rate:.1f}B")

输出依次为全年收入/年底年化规模:750.0B/750.0B、375.0B/750.0B、262.5B/525.0B、157.5B/315.0B。真实项目应使用逐月交付容量替换一次性上线假设;容量价格和硬件效率也不会始终不变。

这组计算适合作为一次压力测试:供给扩张后,如果利用率与单位收入仍维持在很高水平,需要多大的付费需求?判断是否过剩,还要继续看实际交付、价格和利用率。

7 供给能追上,需求也可能再次改变

当前短缺可以理解为需求与供给的时间错位:2026 年的 Agent 需求,遇到了 2025 年末的供给。供应链需要时间调整,扩张完成后可能追上甚至超过需求;持久运行的 AI 等新阶段,又可能带来下一轮需求增长。[1,18:45–19:21]

供需两端都在变化。芯片、封装和机房扩张,把更多容量交到客户手里;模型能力与工作流的变化,则让更多任务值得交给 AI。服务价格下降还可能吸引原本付不起成本的使用。最终结果取决于这些变化的速度,以及它们如何转化为实际付费任务。

供给扩张还会遇到产业之外的约束。数据中心建设、财富集中、知识与数据归属,都可能影响公众对 AI 的态度。硅谷内部对技术的热情,也需要回应圈子之外对成本和收益分配的关注。[1,19:49–20:48]

AI 广告牌上的收益分配质问

广告牌上的文字质问 AI 的经济利益分配,取帧时间 20:17;对应讲解区间 19:49–20:26。这是一个现场线索,不是民意统计。

这让“供给能不能上线”有了更完整的含义。设备与电力是物理条件,客户付费是经济条件,建设与运营还需要社会接受。更强的模型能够增加技术价值,却不会自动解决利益如何分配的问题。

跟踪这轮算力扩张,需要同时看四件事:容量何时真正可用;能完成多少验收合格的任务;这些任务带来多少收入和客户价值;价格变化后,资产能否在经济寿命内收回完整成本。

今天缺算力,可以是真实的经营约束;未来租价下降,也可能是供应链扩张后的结果。把投产时间、有效利用率和任务价值放回同一条链,才有办法判断这两种状态之间会怎样转换。

参考

论文用于解释推理工作负载,视频与访谈提供产业观察,官方公告用于核对技术路线和披露口径。

  • [1] Asianometry,2026,Silicon Valley’s Starving for Compute,原视频,2026-09-13。正文截图均来自该视频,已注明取帧时间和讲解区间。
  • [2] Charlie Snell、Jaehoon Lee、Kelvin Xu、Aviral Kumar,2024,Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters,arXiv:2408.03314。
  • [3] Yongtong Wu 等,2026,DualPath: Breaking the Storage Bandwidth Bottleneck in Agentic LLM Inference,arXiv:2602.21548。
  • [4] Anthropic,2026,Higher usage limits and a SpaceX compute deal,官方公告,2026-05-06。
  • [5] OpenAI / Broadcom,2026,OpenAI and Broadcom unveil LLM-optimized inference chip,Jalapeño 官方介绍,2026-06-24。
  • [6] TSMC,2026,TSMC Debuts A13 Technology at 2026 North America Technology Symposium,官方新闻稿,第 2 页,2026-04-22。
  • [7] TSMC,CoWoS,官方技术介绍,持续更新页面。
  • [8] OpenAI,2026,Research acceleration: The view inside OpenAI,研究代理指标与方法,2026-09-06。
  • [9] Dwarkesh Podcast,2026,Dylan Patel – Anthropic & OpenAI will have most of the world’s compute by 2028,原始访谈与转写,2026-08-25。单位功率收入与未来容量属于受访者估计。
  • [10] SpaceX,2026,EU Prospectus,发行人官方招股书,2026-06-05,印刷页 64(PDF 第 77 页)。
  • [11] CoreWeave,CoreWeave Cloud Platform,官方平台介绍,持续更新页面,访问于 2026-10-04。
  • [12] Nebius,Nebius AI Cloud,官方平台介绍,持续更新页面,访问于 2026-10-04。
  • [13] Safe Superintelligence Inc.,Safe Superintelligence Inc.,官方使命说明,访问于 2026-10-04。
  • [14] PyTorch,Getting Started with Distributed Data Parallel,官方教程,尤其是梯度同步与 Skewed Processing Speeds 小节,访问于 2026-10-04。
  • [15] NVIDIA,NVIDIA DGX H100/H200 User Guide,官方系统功率规格,访问于 2026-10-04。
  • [16] NVIDIA,NVIDIA DGX B300 User Guide,官方系统功率规格,访问于 2026-10-04。