越聪明,越烧钱:下一代AI靠什么?

财经头条

3天前

上周日(719晚,Kimi发布了一则不太寻常的公告:暂停C端新用户订阅。

原因是Kimi K3上线后用户请求量已大幅超出预估,并且逼近现有集群的承载极限。公司决定将已有算力全部用于保障已订阅用户,同时全速推进扩容。

一个产品因为太火而暂停接客,这在消费互联网时代并不罕见——小米手机早期抢购、ChatGPT刚上线时暂停注册,都历历在目。但Kimi这次不太一样暂停的不是免费用户的注册通道,而是付费会员的购买入口。

对一家商业公司而言,暂停用户氪金并不是一个轻易做出的决定。这跟制造稀缺感有本质区别如果只是想营造供不应求的氛围,完全可以通过排队、限流、提高价格来实现,没必要直接切断收入。

所以这则公告至少说明:K3上线后的真实使用需求,已经超过了现阶段算力资源的承载能力。

车到山前必有路”。当应用端的算力压力开始普遍出现,基础设施侧的技术迭代也在同步加速。

几乎在同一时间WAIC 2026在上海举办华为、阿里云、壁仞科技、摩尔线程、燧原科技、沐曦股份、曦智科技等多家企业集中发布了各自的超节点产品。

一边是应用端的算力告急,一边是超节点的技术集中亮相。它们不是因果关系,而是同一个产业趋势下的两个切面。

训练是首付,推理是月供

过去几年,AI行业的核心竞争逻辑很简单:谁能训练出更强的模型?

更大参数、更长上下文、更高评分——每一次模型发布都是一场军备竞赛的阶段性成果。Kimi K3也拿出了足够亮眼的成绩:在多个第三方评测中表现突出,代码能力等任务测试中取得领先成绩。连马斯克都留了一句Impressive

但很多人忽略了一个问题:训练出一流模型,只是开始。

这也是AI商业模式与传统软件最大的不同之一。传统软件的边际成本趋近于零——多一个用户,几乎不增加成本。而AI不同,每一次调用都在消耗真实的计算资源。

训练更多是一笔集中投入,而推理则是一项持续发生的运营成本。用户越多、任务越复杂,推理成本就越高。就像买车:首付再高,真正让人肉疼的是每个月的油钱和保养。

尤其进入Agent时代之后,更好的模型,月供自然比以前贵得多。

华泰证券在最新研报中将K3定义为“能力跨越带来模型价值重估”的标志性产品。2.8万亿参数、100Token上下文和原生视觉能力,使其从对话模型进一步延伸至长时程编程、知识工作与复杂推理等真实生产场景。

AI不再只是问一句,答一句。以一个典型的复杂Agent任务为例:分析资料、调用工具、写代码、执行任务、多轮修改一次用户指令可能触发几十次甚至上百次模型调用。

官方演示中,K3生成AI ASIC行业研究网站时经历了120轮以上递归改进,完成2800次以上网页搜索与抓取,处理超过1.1万页内容。每一个子任务都在消耗GPU时间。

用户感知到的是一次提交任务,但后台可能是几十分钟的持续运行。AI正在从回答问题的软件,变成持续工作的数字员工——这也是为什么AI时代的爆款产品,不一定天然意味着高利润。用户越多,推理成本越高,规模效应和成本压力同时存在。

Kimi遇到的不是模型不行的问题。恰恰相反,正是因为模型能力足够强,才让越来越多的人敢把越来越复杂的任务交给它。而这种复杂度,正在快速推高单位用户背后的算力消耗。

省算力缺算力,是一体两面

这里有一个很容易被误解的地方。

就在K3发布前后,Kimi还在强调模型效率的提升根据官方数据,K3相较K2整体缩放效率提升约2.5倍。很多人会自然地推断:效率提升了,算力需求应该下降才对。怎么反而更缺了以至于把收入往外推

这是一个经典的认知陷阱:单位效率提升,不代表总需求下降。

举个例子,以前一个任务消耗100单位算力,优化后只需要60。看起来省了40%。但假设因为效率提升、体验变好,用户规模增长了10倍,或者每个用户发起的任务复杂了10倍——总需求依然会暴涨。

这种现象在经济学里有个名字叫杰文斯悖论。1865年,英国经济学家杰文斯发现:蒸汽机效率大幅提升后,英国的煤炭消耗总量不降反升。因为效率提升降低了使用成本,反而刺激了更多应用场景的涌现。

互联网、云计算都经历过类似的路径。AI很可能正在成为下一个。这是技术进步的经典剧本效率提升不是在消灭需求,而是在激活更多需求。

当单卡竞赛变成系统竞赛

但问题来了:需求被激活之后,怎么接住?

传统的方式是加卡——缺算力就买更多的GPU插进机柜。但这件事在千卡、万卡级别已经行不通了。因为GPU之间的通信正在成为新的瓶颈。

打个比方:1000个人一起做题,如果每做一步,所有人都必须停下来等其他人对完答案才能继续,那么这1000个人的效率可能还不如100个人各做各的。关键在于让这1000个人像一个统一计算单元那样协同。

超节点要解决的就是这个问题——通过高速互联技术把分散在数十台服务器里的成百上千张芯片,压进一个低延迟、高带宽的域内,让它们协同工作。

本届WAIC上,华为首次公开展示了昇腾950超节点真机,实现1024卡级高速互联与256TB全局统一内存编址。此前发布的昇腾384超节点也已经进入商业部署阶段。

阿里云首次通过公共云对外提供超节点形态的AI算力服务。曦智科技的光跃LightSphereX超节点已实现2000卡商业化落地。此外,壁仞、燧原、沐曦、摩尔线程等企业也相继发布了各自的超节点方案。

开源证券的判断是:众多超节点集中亮相,表明国产芯片厂商已形成集团军式系统级方案的战略判断,以弥补单卡算力性能的相对短板。国产算力正从单点性能追赶转向系统架构创新的新阶段,2026年或成为国产超节点放量元年。国盛证券则认为,集群工程能力与软件生态正在成为核心壁垒,国产算力将进入系统级竞争时代。

这些话翻译过来就是:以前大家比的是谁的单张卡更快,现在比的是谁能让一千张卡一起好好干活英伟达,正是行业的先驱

英伟达真正的壁垒GPU硬件。是一整套系统——CUDA生态、NVLink/NVSwitch高速互联、InfiniBand网络、软件工具链、集群调度、数据中心工程能力。GPU只是其中一个环节。

换句话说,英伟达卖的不是芯片,而是一整套让芯片们好好协作的解决方案。

国产算力过去几年一直在追赶单卡性能,这当然重要。但当单卡差距短期内难以抹平时,系统能力就成了一条值得投入的追赶路径。这意味着,未来算力竞争未必只是单颗芯片性能的竞争,而是芯片、互联、软件和调度能力的综合竞争。

这也是为什么今年WAIC上几乎所有头部厂商都不约而同地把超节点作为重点展示方向——它不是一项孤立的新技术,而是在推理时代背景下,算力基础设施的一次系统性升级。

而华泰特别指出,K3官方建议采用64张以上加速卡组成的超节点部署,这意味着高带宽互联和集群工程能力,正在成为决定模型能否商业化的关键变量。

从创造智能到组织智能

回到Kimi的公告。

它之所以值得关注,不是因为Kimi缺算力这件事本身有多新鲜——算力短缺在这个行业早已不是新闻。真正值得注意的是它发生的时间节点:一个新模型上线后,很快就面临算力调度压力。

这至少说明,AI应用正在从能力展示阶段,向真实使用阶段迈进。而大规模使用的算力消耗,可能正在超预期爆发。

模型能力决定了能飞多高

推理效率决定了能飞多久;

基础设施决定了能承载多大的用户规模,

商业化能力决定了这件事能不能持续。

这四个维度,共同构成了一家AI公司在下一个阶段的竞争底盘。

过去几年,AI行业的核心问题是:如何让机器变得更聪明。

接下来,行业的问题将变成:如何让这个越来越聪明的机器,服务越来越多的人。

Kimi的算力压力,不是一个孤立事件;超节点的集中出现,也不只是一次技术展示。它们共同说明,AI竞争正在进入一个新的阶段:过去比的是谁能创造更聪明的智能,未来比的是谁能把智能组织起来,并以更低成本、更大规模交付给用户。


上周日(719晚,Kimi发布了一则不太寻常的公告:暂停C端新用户订阅。

原因是Kimi K3上线后用户请求量已大幅超出预估,并且逼近现有集群的承载极限。公司决定将已有算力全部用于保障已订阅用户,同时全速推进扩容。

一个产品因为太火而暂停接客,这在消费互联网时代并不罕见——小米手机早期抢购、ChatGPT刚上线时暂停注册,都历历在目。但Kimi这次不太一样暂停的不是免费用户的注册通道,而是付费会员的购买入口。

对一家商业公司而言,暂停用户氪金并不是一个轻易做出的决定。这跟制造稀缺感有本质区别如果只是想营造供不应求的氛围,完全可以通过排队、限流、提高价格来实现,没必要直接切断收入。

所以这则公告至少说明:K3上线后的真实使用需求,已经超过了现阶段算力资源的承载能力。

车到山前必有路”。当应用端的算力压力开始普遍出现,基础设施侧的技术迭代也在同步加速。

几乎在同一时间WAIC 2026在上海举办华为、阿里云、壁仞科技、摩尔线程、燧原科技、沐曦股份、曦智科技等多家企业集中发布了各自的超节点产品。

一边是应用端的算力告急,一边是超节点的技术集中亮相。它们不是因果关系,而是同一个产业趋势下的两个切面。

训练是首付,推理是月供

过去几年,AI行业的核心竞争逻辑很简单:谁能训练出更强的模型?

更大参数、更长上下文、更高评分——每一次模型发布都是一场军备竞赛的阶段性成果。Kimi K3也拿出了足够亮眼的成绩:在多个第三方评测中表现突出,代码能力等任务测试中取得领先成绩。连马斯克都留了一句Impressive

但很多人忽略了一个问题:训练出一流模型,只是开始。

这也是AI商业模式与传统软件最大的不同之一。传统软件的边际成本趋近于零——多一个用户,几乎不增加成本。而AI不同,每一次调用都在消耗真实的计算资源。

训练更多是一笔集中投入,而推理则是一项持续发生的运营成本。用户越多、任务越复杂,推理成本就越高。就像买车:首付再高,真正让人肉疼的是每个月的油钱和保养。

尤其进入Agent时代之后,更好的模型,月供自然比以前贵得多。

华泰证券在最新研报中将K3定义为“能力跨越带来模型价值重估”的标志性产品。2.8万亿参数、100Token上下文和原生视觉能力,使其从对话模型进一步延伸至长时程编程、知识工作与复杂推理等真实生产场景。

AI不再只是问一句,答一句。以一个典型的复杂Agent任务为例:分析资料、调用工具、写代码、执行任务、多轮修改一次用户指令可能触发几十次甚至上百次模型调用。

官方演示中,K3生成AI ASIC行业研究网站时经历了120轮以上递归改进,完成2800次以上网页搜索与抓取,处理超过1.1万页内容。每一个子任务都在消耗GPU时间。

用户感知到的是一次提交任务,但后台可能是几十分钟的持续运行。AI正在从回答问题的软件,变成持续工作的数字员工——这也是为什么AI时代的爆款产品,不一定天然意味着高利润。用户越多,推理成本越高,规模效应和成本压力同时存在。

Kimi遇到的不是模型不行的问题。恰恰相反,正是因为模型能力足够强,才让越来越多的人敢把越来越复杂的任务交给它。而这种复杂度,正在快速推高单位用户背后的算力消耗。

省算力缺算力,是一体两面

这里有一个很容易被误解的地方。

就在K3发布前后,Kimi还在强调模型效率的提升根据官方数据,K3相较K2整体缩放效率提升约2.5倍。很多人会自然地推断:效率提升了,算力需求应该下降才对。怎么反而更缺了以至于把收入往外推

这是一个经典的认知陷阱:单位效率提升,不代表总需求下降。

举个例子,以前一个任务消耗100单位算力,优化后只需要60。看起来省了40%。但假设因为效率提升、体验变好,用户规模增长了10倍,或者每个用户发起的任务复杂了10倍——总需求依然会暴涨。

这种现象在经济学里有个名字叫杰文斯悖论。1865年,英国经济学家杰文斯发现:蒸汽机效率大幅提升后,英国的煤炭消耗总量不降反升。因为效率提升降低了使用成本,反而刺激了更多应用场景的涌现。

互联网、云计算都经历过类似的路径。AI很可能正在成为下一个。这是技术进步的经典剧本效率提升不是在消灭需求,而是在激活更多需求。

当单卡竞赛变成系统竞赛

但问题来了:需求被激活之后,怎么接住?

传统的方式是加卡——缺算力就买更多的GPU插进机柜。但这件事在千卡、万卡级别已经行不通了。因为GPU之间的通信正在成为新的瓶颈。

打个比方:1000个人一起做题,如果每做一步,所有人都必须停下来等其他人对完答案才能继续,那么这1000个人的效率可能还不如100个人各做各的。关键在于让这1000个人像一个统一计算单元那样协同。

超节点要解决的就是这个问题——通过高速互联技术把分散在数十台服务器里的成百上千张芯片,压进一个低延迟、高带宽的域内,让它们协同工作。

本届WAIC上,华为首次公开展示了昇腾950超节点真机,实现1024卡级高速互联与256TB全局统一内存编址。此前发布的昇腾384超节点也已经进入商业部署阶段。

阿里云首次通过公共云对外提供超节点形态的AI算力服务。曦智科技的光跃LightSphereX超节点已实现2000卡商业化落地。此外,壁仞、燧原、沐曦、摩尔线程等企业也相继发布了各自的超节点方案。

开源证券的判断是:众多超节点集中亮相,表明国产芯片厂商已形成集团军式系统级方案的战略判断,以弥补单卡算力性能的相对短板。国产算力正从单点性能追赶转向系统架构创新的新阶段,2026年或成为国产超节点放量元年。国盛证券则认为,集群工程能力与软件生态正在成为核心壁垒,国产算力将进入系统级竞争时代。

这些话翻译过来就是:以前大家比的是谁的单张卡更快,现在比的是谁能让一千张卡一起好好干活英伟达,正是行业的先驱

英伟达真正的壁垒GPU硬件。是一整套系统——CUDA生态、NVLink/NVSwitch高速互联、InfiniBand网络、软件工具链、集群调度、数据中心工程能力。GPU只是其中一个环节。

换句话说,英伟达卖的不是芯片,而是一整套让芯片们好好协作的解决方案。

国产算力过去几年一直在追赶单卡性能,这当然重要。但当单卡差距短期内难以抹平时,系统能力就成了一条值得投入的追赶路径。这意味着,未来算力竞争未必只是单颗芯片性能的竞争,而是芯片、互联、软件和调度能力的综合竞争。

这也是为什么今年WAIC上几乎所有头部厂商都不约而同地把超节点作为重点展示方向——它不是一项孤立的新技术,而是在推理时代背景下,算力基础设施的一次系统性升级。

而华泰特别指出,K3官方建议采用64张以上加速卡组成的超节点部署,这意味着高带宽互联和集群工程能力,正在成为决定模型能否商业化的关键变量。

从创造智能到组织智能

回到Kimi的公告。

它之所以值得关注,不是因为Kimi缺算力这件事本身有多新鲜——算力短缺在这个行业早已不是新闻。真正值得注意的是它发生的时间节点:一个新模型上线后,很快就面临算力调度压力。

这至少说明,AI应用正在从能力展示阶段,向真实使用阶段迈进。而大规模使用的算力消耗,可能正在超预期爆发。

模型能力决定了能飞多高

推理效率决定了能飞多久;

基础设施决定了能承载多大的用户规模,

商业化能力决定了这件事能不能持续。

这四个维度,共同构成了一家AI公司在下一个阶段的竞争底盘。

过去几年,AI行业的核心问题是:如何让机器变得更聪明。

接下来,行业的问题将变成:如何让这个越来越聪明的机器,服务越来越多的人。

Kimi的算力压力,不是一个孤立事件;超节点的集中出现,也不只是一次技术展示。它们共同说明,AI竞争正在进入一个新的阶段:过去比的是谁能创造更聪明的智能,未来比的是谁能把智能组织起来,并以更低成本、更大规模交付给用户。


展开
财经头条声明:所载内容仅为传递信息目的,非本站观点,亦非投资建议。据此操作,风险自负。 商务合作:app@feheadline.com
打开“财经头条”阅读更多精彩资讯
APP内打开