近日,风险投资机构 a16z 宣布成立一支 11 亿美元的“机器时代基金”(Machine Age Fund),用于投资 AI 相关的物理层基础设施:涵盖芯片、内存、网络、存储、数据中心、机器人以及家用 AI 设备等。
随后,a16z 的联合创始人 Ben Horowitz、普通合伙人 Martin Casado,以及管理合伙人 Raghu Raghuram 进行了一场对谈,详细解释了为什么要在这个时间点专门成立这样一支基金。
几个人反复谈到:过去几年,AI 行业最受关注的是模型还能不能继续 Scaling,但当模型能力不断提高、应用开始大规模落地之后,真正跟不上的东西正在从模型本身转移到底层基础设施。
Raghu 对此有一个很形象的说法。过去谈计算基础设施,无非是服务器、存储和网络,但这一轮 AI 基础设施如果继续往下追,最终甚至可以一路追到矿山和铜矿。Ben 的说法更直接:新的芯片、系统软件、供电方式,甚至底层连接方式都需要变化。
Martin 则认为,这一轮 AI 和过去的软件时代有一个很大的不同。传统软件开发首先是工程问题,多投入资金、多招工程师,并不能让项目按比例提速。但现在,更多资金可以买来更多计算资源,而更多计算资源又可以投入训练和推理。对 AI 来说,资源本身正在成为越来越重要的限制条件。
这也是“机器时代基金”背后的核心逻辑:如果模型能力和应用继续增长,接下来需要解决的,很可能不仅是更好的算法,还有支撑这些算法运行的整套机器和基础设施。
AI 算力需求为什么还没到顶?
a16z 对这支基金最重要的判断之一,是 AI 对计算资源的需求仍然会继续增长。
最早的大模型主要是聊天:用户提出一个问题,模型生成一个答案,一轮任务就结束了。但进入推理模型和 Agent 阶段之后,一次任务背后的计算过程明显变长。
比如,一次普通聊天可能只消耗上百个 token,而一个 Agent 完成任务可能需要几千个 token。强化学习、思维链和长期运行的 Agent,本质上都在通过更多推理扩展模型能力。换句话说,现阶段很多提高 AI 能力的方法,本身就意味着消耗更多计算。
与此同时,AI 能处理的任务范围也在扩大。编程是较早被 AI 深度改变的场景,但 Martin 提到,他现在已经会让 Agent 帮自己更新不同服务里的信用卡信息、取消订阅和整理邮件。这些事情与写代码没有关系,而是过去需要人坐在电脑前逐项完成的普通工作。
Raghu 将这种变化形容为,在电脑里创造出了一批知识工作者;Ben 也把 Agent 称作一种“新型员工”。
当然,这类 Agent 仍然存在很多问题。Ben 提到,它们可能消耗大量 Token 却没有完成有效工作,也会忘事、产生幻觉,并带来安全风险。但与此同时,它们也可以非常高效。因此,他认为企业接下来需要学习的,是如何让这些 Agent 与人类员工一起工作。
因此,在 a16z 看来,编程只是一个开始。Raghu 提到,全球还有大量知识工作者没有真正进入 AI 工作流;再往后,还有科学、材料、生物、创意生产,以及机器人等场景。
Martin 因此更愿意把 AI 类比为蒸汽机或者电力。在他看来,人类可能还需要几十年,才能逐步找到计算可以被投入哪些问题之中。今天语言和代码已经率先被解锁,电脑操作刚刚开始,还有大量领域没有真正展开。
AI 还存在一个特殊之处,它可以被用来创造和优化更多 AI。Martin 将这种现象称为一种“自催化效应”。它可以被用来优化训练代码,甚至参与设计下一代 AI 系统。AI 越强,就越可能被用来创造更多 AI,并进一步产生新的算力需求。只要更多 GPU 和资金仍然能够换来更好的结果,a16z 就认为,这条需求曲线暂时还很难见顶。
真正短缺的,不只是 GPU
如果说需求侧的问题是 AI 消耗算力的速度越来越快,那么供给侧的问题更直接:现实世界很难用同样的速度扩产。
Raghu 在对谈中提到,最能感知真实算力需求的几家 Hyperscaler 仍在大幅增加资本开支。按照他给出的数字,今年这些公司的资本开支合计已经达到 7,000 多亿美元,未来还可能继续向 1 万亿美元靠近。他认为,这些云厂商能够同时看到来自前沿 AI 实验室、AI 原生公司、企业客户以及不同地区市场的算力需求,因此它们持续增加资本开支,是需求侧一个值得关注的信号。
供给端的信号同样明显。Martin 提到,一些关键基础设施产能已经被提前预订到 2028 年;Raghu 则称,一家头部内存厂商仅靠目前已经拿到的订单,就需要未来三年的产能才能满足。
这也是他们在对谈中反复拿今天与互联网泡沫时期比较的原因。上世纪 90 年代末,市场也曾大规模投资互联网基础设施,大量光纤被提前铺设,后来却出现了不少长期没有使用的“暗光纤”。Ben 回忆道,当时的问题在于,基础设施建设跑在了真实需求前面:互联网用户还没有足够多,视频等真正消耗大量带宽的应用也没有成熟。
今天的 AI 更像是反过来:需求已经出现,真正跟不上的是供给。
而这个供给问题并不限于 GPU,Ben 总结为:“电力、冷却、内存、GPU,你说什么,我们就缺什么。”一套 AI 集群不仅需要计算芯片,还需要高带宽内存、网络互联、电源和冷却系统。继续向外延伸,还涉及数据中心、电网接入、变压器和发电能力。
随着 AI 服务器功率不断提高,过去为传统云计算设计的数据中心也开始出现不适配的问题。机架功率正在从过去大约 5-10kW,提升到 100-150kW。功率密度快速上升之后,风冷越来越难满足需求,Ben 表示,液冷对于前沿数据中心来说已经基本成为必要配置。
供电方式、建筑设计和施工条件也会随之变化。Raghu 提到,当数据中心使用更高电压时,能够处理相关系统的专业施工人员也会成为限制条件。Ben 还谈到,一些大型科技公司已经开始培训相关技术工人。
更难解决的是建设周期。芯片周期通常需要三到四年,而数据中心从破土动工到建成往往需要四到五年。而且数据中心建好后还要解决电网接入和电源问题,而变压器、涡轮机等设备本身也存在供应限制。
Raghu 用一个简单的对比概括这种错配:如果一个传统产业能够以每年 20%-30% 的速度增长,已经是很好的增长水平,但它现在需要承接的是一个以三位数速度增长的 AI 软件行业。
这也是为什么 a16z 认为,AI 基础设施的问题已经不只是芯片产能,而是整个物理基础设施体系能不能跟上 AI 的增长速度。
AI 基础设施,可能要重新设计一遍
如果只是短缺,最直接的答案是扩产。但 a16z 更看重的是这一轮需求可能迫使现有计算基础设施发生架构上的变化。
Raghu 在对谈中提出,很多现有基础设施原本并不是为 AI 工作负载设计的,因此需要重新从最基础的问题出发:模型究竟在执行什么样的计算,内存应该如何组织,芯片之间怎么通信,功耗如何分配,最后再把这些部分重新组合成一套系统。
因此,“机器时代基金”关注的不只是下一颗计算芯片,而是计算芯片、内存、网络、电源芯片、系统软件等整个基础设施链条。
Martin 则用一笔经济账解释了为什么这种变化现在开始变得重要。
按照他的估算,训练一个前沿模型可能需要 30 亿至 50 亿美元,训练完成之后,还需要通过大规模推理收回前期投入。假如推理端最终对应约 100 亿美元的收入,效率提高 20%,就相当于创造了约 20 亿美元的价值,这个量级已经足以覆盖一颗 ASIC 的开发成本。
这并不意味着未来一定会走向“一模型一芯片”,但单个 AI 系统消耗数十亿美元计算资源后,定制芯片已经获得了足够强的商业动力。这也是为什么 a16z 认为,即使英伟达已经在 AI 基础设施市场占据巨大优势,初创公司仍然会有机会。
Martin 则从产业规律解释这种机会。一家市值数万亿美元的公司会优先解决最大的市场,但即使只是它无法顾及的 5%,也足以支撑一家规模巨大的公司。市场快速扩张时期,使用场景会不断增加,产业链往往会先变得更加碎片化,等到增速放缓之后才重新整合。今天的 AI 基础设施显然仍然处于前一个阶段。
这种变化也正在重新吸引创业者。他还提到,过去顶级创业项目中真正选择硬件方向的可能只有几个百分点,而现在已经明显提高到 20%-30%。与过去二十年大量年轻创始人从软件切入不同,这一轮基础设施创业中还出现了很多有多年芯片、系统和供应链经验的“老兵”。
原因在于,做 AI 基础设施公司并不是把一项实验室技术做出来就结束了。创始人需要考虑芯片怎么设计、谁来制造、产能在哪里、内存和网络怎么配套、系统怎样集成,以及最终怎样大规模交付。Raghu 将这类人称为“系统级创始人”。在他看来,黄仁勋就是最典型的案例:真正优秀的硬件创业者在设计产品之初,就已经需要把整个生态系统和供应链同时考虑进去。
与此同时,创业环境也和五年前不同。AI 实验室对计算资源极度渴求,因此比过去更愿意和尚未成熟的硬件公司提前合作,一些产品还没有真正交付,客户就已经愿意签订协议。资本市场对重资产 AI 项目的接受程度也明显提高。软件创业可以先花很少的钱做出产品,再验证市场,但芯片公司可能在产品出现之前就需要投入数亿美元。如果没有今天的 AI 需求和资本环境,很多项目很难真正启动。
这最终构成了 a16z 此时推出“机器时代基金”的投资逻辑:当生成式 AI 进一步放大软件能力之后,下一阶段的重要瓶颈反而会落到底层机器上。
过去二十年,硅谷最核心的叙事之一是软件不断向更多行业扩张。a16z 自己最著名的判断之一,也是“软件正在吞噬世界”。但到了生成式 AI 阶段,一个有些反差的变化开始出现:软件能力继续快速扩大,真正难以同步扩张的却变成了底层机器。
模型可以几个月迭代一次,但芯片仍然需要制造,数据中心仍然需要建设,电力仍然需要生产,变压器和涡轮机也有自己的交付周期。
所以 a16z 所谓的“机器时代”,并不是认为 AI 的 Scaling 即将结束。恰恰相反,他们押注的是另一种结果:如果智能还要继续快速 Scaling,那么承载这些智能的机器,以及机器背后的整个物理基础设施,也不得不跟着重新建设一遍。
1.https://www.youtube.com/watch?v=Zx1Ec8LWFeM
2.https://a16z.com/the-machine-age-fund/?utm_source=chatgpt.com
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成

