算力“分层”:万卡集群是门面,百P推理才是生意

过去三年,算力行业比的是“谁更大”。万卡集群、十万卡集群,数字越喊越大。每有一个新的万卡集群建成,就会成为行业新闻的标题。这些巨型集群,确实在支撑着最前沿的大模型训练——参数量动辄千亿、万亿的模型,不是几百张卡能跑出来的。但当你把这些巨型集群当作算力行业的全部,就会错过一个正在发生的结构性变化:算力市场正在分层。一端是“门面”——面向头部企业的万卡级超大集群,另一端是正在快速膨胀的“生意”——百P级推理和微调算力需求。
一、万卡集群是“核武器”,不是日常工具
万卡集群的价值主要体现在训练侧。训练一个千亿参数的大模型,确实需要万卡级别的算力,把训练时间从几个月压缩到几周。这类需求集中在少数头部企业——全球能建万卡集群的企业屈指可数。它的性质更像“国家级实验室的设备”——成本极高、门槛极高、客户极少。但对于绝大多数企业来说,他们不需要训练一个万亿参数的大模型,他们需要的是用现有的模型解决具体的业务问题,比如客服机器人、智能文档处理、代码生成、行业数据分析。这类任务的算力需求,是百P级别就够用的。用一个比喻来理解这个差异:万卡集群是“核电站”——投资巨大、技术复杂,只能由少数头部企业建设运营;百P推理集群是“分布式光伏”——可以建在工厂屋顶、商业楼宇,甚至居民小区旁边。巨型集群追求的是“能不能训练出更大的模型”,百P集群追求的是“能不能以更低的成本跑通一个具体的业务场景”。后者是“生意”,前者是“实力展示”。门面永远需要有一两个,但真正撑起市场的,是生意。
二、推理算力占比已达50%,并且还在涨
算力市场正在发生一个根本性的需求转移。大模型的竞争重心,正在从“训练出更聪明的模型”转向“让现有模型跑得更便宜、更快”。推理需求的增长曲线正在超越训练需求。摩根大通研报预测,中国的推理算力Token消费量将从2025年的10千万亿增长到2030年的3900千万亿,增幅369倍。德勤预测2026年推理任务将占据全球AI总计算负载的三分之二。国内AI大模型周Token调用量已突破14.19万亿,连续六周超越美国位居全球第一。智算中心的平均算力利用率长期在30%-40%之间徘徊,根源在于需求与供给的结构性错配:训练集群要求极高,推理集群则相对宽容,两个需求池对算力资源的规格、规模、调度方式的要求都不一样。算力中心如果不能同时兼顾两类需求,就可能陷入“算力闲置”与“高峰算力不足”并存的困境。既能满足训练的高性能需求,又能支持推理的高并发需求,才是下一阶段的竞争关键。
三、百P推理集群的“经济账”
推理对延迟的敏感度极高。一个聊天机器人如果在10秒后才回复,用户可能已经关掉了页面。这意味着推理算力不能离用户太远,它需要部署在靠近客户的地方。推理能力的部署正在变得分散、本地化和碎片化。百P算力的前置投入也远低于万卡集群。一个百P级的推理集群,设备采购成本和机房改造成本都可以控制在合理范围内,不需要特殊的液冷方案,不需要超高密度的组网架构。更关键的是,它的客户是“具体的企业”,而不是“少数头部模型厂商”。这种集群的回报逻辑比训练集群更清晰。训练集群的ROI建立在“能不能训练出有商业价值的模型”上,这是一个高度不确定的命题。推理集群的ROI建立在“有多少企业愿意为AI能力付费”上,这个问题正在被大规模验证。
四、万卡集群的“门面效应”正在消退
当行业里只有一两个万卡集群的时候,它确实能构成先发优势。但当万卡集群变成“标配”——有十几家企业都在建万卡集群、几十个城市都在规划智算中心的时候,这个标签就已经不值钱了。真正的竞争,不在“谁有万卡”,而在“谁能把算力真正卖出去”。头部大厂的模型训练确实需要万卡,但这个市场的容量有限——全球能用满万卡集群的企业不会超过两位数。行业过剩已经开始出现征兆。部分地区的算力中心,建好了但租不出去。这种现象背后的原因在于需求分层:万卡集群的建造标准与推理市场的一般性需求之间存在结构性错配,不是所有建成的算力都能被市场消化。
五、写在最后
算力市场的竞争逻辑正在从“建更大”转向“算更细”。未来的赢家,不会是那个把万卡集群建得最大、宣传得最响的,而是那个能把算力精准匹配到不同层次需求的。万卡集群是门面,百P推理才是生意。门面需要有一两个,但真正撑起这个行业的,是海量的、分散的、持续增长的百P级推理需求。这个市场,比万卡集群大得多,也持久得多。