AI应用落地+模型调用需求爆发 产业链公司梳理

丰华财经

1天前

688***:公司深耕流程工业领域,主营工业自动化管控与工业AI落地解决方案,是大模型技术向实体产业垂直落地的代表性企业,核心将通用大模型能力适配至化工、石化等流程工业场景,落地应用覆盖设备智能管理、生产精准控制、企业经营数据分析等核心工业环节。
导读AI智能体(Agent)规模化落地,进一步放大了这套系统协同差距,让单一硬件堆叠的弊端持续凸显。

国内AI大模型调用规模在近两年迎来指数级爆发增长

国内AI大模型调用规模在近两年迎来指数级爆发增长,算力需求逻辑彻底迭代升级。2024年初国内大模型日均Token调用量仅为1000亿级别,2025年底已攀升至100万亿,截至2026年3月进一步突破140万亿,两年时间整体增幅高达1400倍。海外AI平台同样呈现高速扩容态势,OpenRouter平台周度Token消耗量从2025年6月第三周的2.36万亿,快速增长至2026年6月第一周的44.6万亿,年内增幅接近18倍,海内外AI应用落地、模型调用需求全面进入爆发周期。

伴随Token调用量井喷式增长,市场对于AI算力的评判标准发生根本性转变。过往行业普遍以GPU数量作为算力实力的核心衡量指标,该指标虽仍具备参考价值,但已无法完整体现集群真实算力产出水平。GPU数量仅能代表理论算力上限,产业实际有效产出效率,更多取决于算力利用率、单位时间Token生成能力、单位Token综合成本,同时高度依赖CPU、内存、存储、高速互联、底层软件系统的全链路协同适配能力。AI智能体(Agent)规模化落地,进一步放大了这套系统协同差距,让单一硬件堆叠的弊端持续凸显。

传统对话式AI交互模式逻辑简单,仅需完成用户输入理解与内容输出即可。而新兴Agent智能体具备自主任务拆解、工具调用、代码执行、信息检索、文件处理、多轮逻辑校验等复杂能力,用户单次表层操作,后台往往会触发数十次模型循环调用,大幅抬升整体Token消耗与系统调度压力,算力需求从简单的增量扩容,转向全链路系统效率优化。

全球GPU租赁价格持续上行

算力需求结构性变革,直接带动全球GPU租赁价格持续上行,真实供需紧张程度通过市场报价直观体现。海外算力厂商Nebius近期全面上调各型号GPU租赁定价,常规按需算力中,B300 NVLink由每小时6.1美元涨至7.85美元、涨幅29%,B200由5.5美元涨至7.15美元、涨幅30%,H100由2.95美元涨至3.85美元、涨幅31%。弹性更强、适配轻量化任务的抢占式实例涨价幅度更高,H200涨幅69%、H100涨幅72%。抢占式算力大幅涨价,意味着市场可调度闲置算力资源持续枯竭,行业整体算力利用率已处于高位。

国内算力市场同步迎来涨价周期

算力、存储、模型服务成本全面抬升并向下游传导。阿里云2026年3月上调多项算力服务价格,区间在5%-34%,其中CPFS智算存储涨幅达30%,4月再度微调模型服务定价,涨幅维持2%-7%。硬件资源与配套服务同步涨价,印证国内算力供需格局持续偏紧,行业成本中枢系统性上移。与此同时,C端商业模式也迎来迭代,豆包在2026年5月上线分层订阅体系,将深度研究、PPT生成、视频制作等高复杂度、高Token消耗任务纳入付费体系,贴合大模型“用多少、耗多少成本”的真实运营逻辑,标志着行业正式进入按使用强度付费的Token商业化时代,倒逼供给端全力提升单位硬件的Token产出效率。

行业现阶段已明确验证,单纯堆砌GPU数量无法同步提升有效算力产出。当前行业主流GPU集群整体利用率仅维持在40%-50%,算力闲置并非源于硬件不足,而是受限于CPU调度效率、数据加载速度、内存传输带宽、跨节点互联延迟等配套瓶颈。在模型训练场景中,超大参数模型的存储传输压力极大,数百GB至数TB的模型参数,会导致海量GPU长时间等待数据就位;模型训练过程中的断点保存同样消耗巨大资源,以1.76万亿参数模型为例,仅单次模型状态保存的数据体量就超20TB,对存储带宽、读写速度要求极高,极易造成大规模算力空转浪费。

大模型推理场景的系统瓶颈同样突出,KV Cache缓存机制可有效降低重复计算压力,但超长上下文、高并发用户场景下,显存与内存占用激增,数据搬运频次大幅提升,进一步拖累整体推理效率。从硬件迭代节奏来看,近两年AI芯片计算性能提升约3倍,但内存带宽仅提升1.6倍、互连带宽提升1.4倍,数据流转速度严重滞后于芯片计算速度,系统瓶颈彻底由“算力不足”转向“数据流转效率不足”,GPU仅决定算力理论上限,全栈系统协同效率才是决定真实Token产出的核心关键。

CPU战略地位迎来显著提升

AI智能体普及背景下,CPU的战略地位迎来显著提升,从传统辅助调度角色升级为制约系统效率的核心环节。传统推理场景中,GPU承担核心计算任务,CPU仅负责简单的数据预处理与调度工作;而Agent复杂任务落地过程中,工具调用、代码运行、数据处理、多轮结果回传均依赖CPU高频调度,CPU与GPU需要持续高频交互,大量场景下CPU处理耗时会直接拖慢GPU运算节奏,造成高端算力空转。相关负载测试显示,批量任务规模扩容后,CPU处理耗时翻倍增长,同时任务并发量提升会显著抬升调度开销与能耗,高并发场景下CPU动态能耗可占系统总动态能耗的44%,成为影响Agent落地效率的核心变量,这也是英伟达新一代系统着重升级CPU配置、提升CPU-GPU互连带宽的核心原因。

超节点技术价值持续凸显

除单服务器软硬件协同优化外,多节点集群的跨设备协同能力,成为超大规模算力落地的关键壁垒,超节点技术价值持续凸显。传统服务器集群依靠网络完成跨节点通信,集群规模越大,通信延迟、数据阻塞问题越突出。超节点通过高速互联技术,将多台服务器整合为统一资源池,实现算力统一调度,大幅降低跨节点通信损耗。同时超节点可针对推理场景的Prefill输入计算、Decode逐字生成两大差异化任务,进行硬件资源拆分适配,精准匹配不同任务的计算、带宽需求,最大化释放集群整体效能。以浪潮信息元脑SD200超节点为例,在DeepSeek大模型测试中实现高效推理输出,充分验证架构优化对算力产出的显著提升作用,当前算力竞争已从单一芯片性能比拼,全面升级为整机、集群、软件栈的系统级设计能力竞争。

国内算力产业迎来模型与硬件双向协同优化的全新阶段,彻底改变以往“模型定型后硬件被动适配”的旧模式,进入同步迭代、联合优化的新阶段。DeepSeek V4大模型的专家并行方案,可同时适配英伟达GPU与华为昇腾NPU两大硬件体系,通过模型结构与硬件架构深度匹配,推理性能提升1.5-1.73倍,最优场景可达1.96倍。华为昇腾950系列芯片支持多类型低精度计算格式,在控精度的前提下降低内存占用、提升计算效率,并针对性优化专家模型访存短板;寒武纪则依托自研软件栈与开源推理框架,实现新模型快速适配落地,持续优化通信与推理链路。模型与硬件的深度协同,能够有效缩短适配周期、降低单位Token成本、提升算力有效产出,成为国产算力突破升级的核心路径。

相关公司

寒武纪:公司主营AI芯片研发与配套软件平台搭建,是国内算力供给端核心硬件厂商,具备完善的模型适配与算力优化服务能力。公司已完成DeepSeek、通义千问、腾讯混元等多款国内主流大模型的适配工作,尤其实现DeepSeek V4版本的首日快速适配,充分体现出公司底层软件栈成熟、模型迭代跟进速度快的核心技术优势。经营层面,公司2025年实现营收64.97亿元、净利润20.59亿元,顺利实现扭亏为盈,2026年一季度营收同比大幅增长159.6%,经营基本面持续向好,整体业务增长具备综合性支撑,业绩提升来源于公司整体业务协同发力,并非单一模型适配或Token需求增长所能简单归因。

海光信息:公司同时布局通用CPU与AI加速DCU双产品线,具备稀缺的芯片系统级协同优化优势,硬件架构适配性较强。公司已完成365款主流大模型的适配工作,依托自研HSL互连技术持续优化CPU与AI加速器之间的通信效率,有效降低数据传输延迟、提升整机协同算力。经营层面,公司2025年营收143.77亿元,同比增长56.92%,2026年一季度延续高增长态势,整体经营成长性突出。需要注意的是,公司模型适配数量行业领先,但模型适配能力仅为技术基础,最终商业化落地成效、业绩兑现能力,仍取决于后续行业实际部署规模与真实算力调用体量。

000***:作为国内AI服务器与算力系统解决方案龙头企业,公司核心价值体现在算力系统集成与全链路优化能力,可整合CPU、GPU、存储、高速互连等各类硬件资源,通过底层系统架构优化有效提升整体算力利用率,精准适配当下算力从硬件堆叠向系统效率升级的行业趋势。公司液冷服务器业务实力行业领先,连续四年稳居国内市场份额首位,能够适配高功耗、高密度AI算力集群的散热需求,契合超节点规模化落地的发展方向。公司2025年实现营收1647.82亿元,同比增长43.3%,营收规模稳步扩张,但利润增速相对滞后,直观反映出当前算力硬件制造行业竞争激烈、盈利承压的行业现状。

688***:公司深耕流程工业领域,主营工业自动化管控与工业AI落地解决方案,是大模型技术向实体产业垂直落地的代表性企业,核心将通用大模型能力适配至化工、石化等流程工业场景,落地应用覆盖设备智能管理、生产精准控制、企业经营数据分析等核心工业环节。工业AI商业化落地逻辑区别于通用大模型,行业持续性收入不仅取决于试点项目数量,更核心在于产品能否切实帮助工业客户降低生产成本、减少设备故障、提升整体生产运营效率。公司2025年实现营收80.73亿元、净利润4.41亿元,基本面稳健,后续工业AI业务的价值兑现,仍需观察各类试点项目能否成功转化为客户长期落地、持续付费的标准化产品服务。

... ...

扫码回复“8-大模型”查看行业公司介绍,并可免费诊股,还可咨询实操指导服务!

IMG_257

作者:于晓明 执业证书编号:A0680622030012

责任编辑:hec

免责声明:陕西巨丰投资资讯有限责任公司(以下简称"巨丰投顾")出品的所有内容、观点取决于市场上相关研究报告作者所知悉的各种市场环境因素及公司内在因素。盈利预测和目标价格的给予是基于一系列的假设和前提条件,因此,投资者只有在了解相关标的在研究报告中的全部信息基础上,才可能对我们所表达的观点形成比较全面的认识。
巨丰投顾出品内容仅为对相关标的研究报告部分内容之引用或者复述,因受技术或其它客观条件所限无法同时完整提供各种观点形成所基于的假设及前提等相关信息,相关内容可能无法完整或准确表达相关研究报告的观点或意见,因而仅供投资者参考之用,投资者切勿依赖。任何人不应将巨丰投顾出品内容包含的信息、观点以及数据作为其投资决策的依据,巨丰投顾发布的信息、观点以及数据有可能因所基于的研究报告发布日之后的情势或其他因素的变更而不再准确或失效,巨丰投顾不承诺更新不准确或过时的信息、观点以及数据,所有巨丰投顾出品内容或发表观点中的信息均来源于已公开的资料,我公司对这些信息的准确性及完整性不作任何保证。巨丰投顾出品内容信息或所表达的观点并不构成所述证券买卖的操作建议。
相关内容版权仅为我公司所有,未经书面许可任何机构和个人不得以任何形式转发、翻版、复制、刊登、发表或引用。

建议意见反馈 jiangy@jfinfo.com
688***:公司深耕流程工业领域,主营工业自动化管控与工业AI落地解决方案,是大模型技术向实体产业垂直落地的代表性企业,核心将通用大模型能力适配至化工、石化等流程工业场景,落地应用覆盖设备智能管理、生产精准控制、企业经营数据分析等核心工业环节。
导读AI智能体(Agent)规模化落地,进一步放大了这套系统协同差距,让单一硬件堆叠的弊端持续凸显。

国内AI大模型调用规模在近两年迎来指数级爆发增长

国内AI大模型调用规模在近两年迎来指数级爆发增长,算力需求逻辑彻底迭代升级。2024年初国内大模型日均Token调用量仅为1000亿级别,2025年底已攀升至100万亿,截至2026年3月进一步突破140万亿,两年时间整体增幅高达1400倍。海外AI平台同样呈现高速扩容态势,OpenRouter平台周度Token消耗量从2025年6月第三周的2.36万亿,快速增长至2026年6月第一周的44.6万亿,年内增幅接近18倍,海内外AI应用落地、模型调用需求全面进入爆发周期。

伴随Token调用量井喷式增长,市场对于AI算力的评判标准发生根本性转变。过往行业普遍以GPU数量作为算力实力的核心衡量指标,该指标虽仍具备参考价值,但已无法完整体现集群真实算力产出水平。GPU数量仅能代表理论算力上限,产业实际有效产出效率,更多取决于算力利用率、单位时间Token生成能力、单位Token综合成本,同时高度依赖CPU、内存、存储、高速互联、底层软件系统的全链路协同适配能力。AI智能体(Agent)规模化落地,进一步放大了这套系统协同差距,让单一硬件堆叠的弊端持续凸显。

传统对话式AI交互模式逻辑简单,仅需完成用户输入理解与内容输出即可。而新兴Agent智能体具备自主任务拆解、工具调用、代码执行、信息检索、文件处理、多轮逻辑校验等复杂能力,用户单次表层操作,后台往往会触发数十次模型循环调用,大幅抬升整体Token消耗与系统调度压力,算力需求从简单的增量扩容,转向全链路系统效率优化。

全球GPU租赁价格持续上行

算力需求结构性变革,直接带动全球GPU租赁价格持续上行,真实供需紧张程度通过市场报价直观体现。海外算力厂商Nebius近期全面上调各型号GPU租赁定价,常规按需算力中,B300 NVLink由每小时6.1美元涨至7.85美元、涨幅29%,B200由5.5美元涨至7.15美元、涨幅30%,H100由2.95美元涨至3.85美元、涨幅31%。弹性更强、适配轻量化任务的抢占式实例涨价幅度更高,H200涨幅69%、H100涨幅72%。抢占式算力大幅涨价,意味着市场可调度闲置算力资源持续枯竭,行业整体算力利用率已处于高位。

国内算力市场同步迎来涨价周期

算力、存储、模型服务成本全面抬升并向下游传导。阿里云2026年3月上调多项算力服务价格,区间在5%-34%,其中CPFS智算存储涨幅达30%,4月再度微调模型服务定价,涨幅维持2%-7%。硬件资源与配套服务同步涨价,印证国内算力供需格局持续偏紧,行业成本中枢系统性上移。与此同时,C端商业模式也迎来迭代,豆包在2026年5月上线分层订阅体系,将深度研究、PPT生成、视频制作等高复杂度、高Token消耗任务纳入付费体系,贴合大模型“用多少、耗多少成本”的真实运营逻辑,标志着行业正式进入按使用强度付费的Token商业化时代,倒逼供给端全力提升单位硬件的Token产出效率。

行业现阶段已明确验证,单纯堆砌GPU数量无法同步提升有效算力产出。当前行业主流GPU集群整体利用率仅维持在40%-50%,算力闲置并非源于硬件不足,而是受限于CPU调度效率、数据加载速度、内存传输带宽、跨节点互联延迟等配套瓶颈。在模型训练场景中,超大参数模型的存储传输压力极大,数百GB至数TB的模型参数,会导致海量GPU长时间等待数据就位;模型训练过程中的断点保存同样消耗巨大资源,以1.76万亿参数模型为例,仅单次模型状态保存的数据体量就超20TB,对存储带宽、读写速度要求极高,极易造成大规模算力空转浪费。

大模型推理场景的系统瓶颈同样突出,KV Cache缓存机制可有效降低重复计算压力,但超长上下文、高并发用户场景下,显存与内存占用激增,数据搬运频次大幅提升,进一步拖累整体推理效率。从硬件迭代节奏来看,近两年AI芯片计算性能提升约3倍,但内存带宽仅提升1.6倍、互连带宽提升1.4倍,数据流转速度严重滞后于芯片计算速度,系统瓶颈彻底由“算力不足”转向“数据流转效率不足”,GPU仅决定算力理论上限,全栈系统协同效率才是决定真实Token产出的核心关键。

CPU战略地位迎来显著提升

AI智能体普及背景下,CPU的战略地位迎来显著提升,从传统辅助调度角色升级为制约系统效率的核心环节。传统推理场景中,GPU承担核心计算任务,CPU仅负责简单的数据预处理与调度工作;而Agent复杂任务落地过程中,工具调用、代码运行、数据处理、多轮结果回传均依赖CPU高频调度,CPU与GPU需要持续高频交互,大量场景下CPU处理耗时会直接拖慢GPU运算节奏,造成高端算力空转。相关负载测试显示,批量任务规模扩容后,CPU处理耗时翻倍增长,同时任务并发量提升会显著抬升调度开销与能耗,高并发场景下CPU动态能耗可占系统总动态能耗的44%,成为影响Agent落地效率的核心变量,这也是英伟达新一代系统着重升级CPU配置、提升CPU-GPU互连带宽的核心原因。

超节点技术价值持续凸显

除单服务器软硬件协同优化外,多节点集群的跨设备协同能力,成为超大规模算力落地的关键壁垒,超节点技术价值持续凸显。传统服务器集群依靠网络完成跨节点通信,集群规模越大,通信延迟、数据阻塞问题越突出。超节点通过高速互联技术,将多台服务器整合为统一资源池,实现算力统一调度,大幅降低跨节点通信损耗。同时超节点可针对推理场景的Prefill输入计算、Decode逐字生成两大差异化任务,进行硬件资源拆分适配,精准匹配不同任务的计算、带宽需求,最大化释放集群整体效能。以浪潮信息元脑SD200超节点为例,在DeepSeek大模型测试中实现高效推理输出,充分验证架构优化对算力产出的显著提升作用,当前算力竞争已从单一芯片性能比拼,全面升级为整机、集群、软件栈的系统级设计能力竞争。

国内算力产业迎来模型与硬件双向协同优化的全新阶段,彻底改变以往“模型定型后硬件被动适配”的旧模式,进入同步迭代、联合优化的新阶段。DeepSeek V4大模型的专家并行方案,可同时适配英伟达GPU与华为昇腾NPU两大硬件体系,通过模型结构与硬件架构深度匹配,推理性能提升1.5-1.73倍,最优场景可达1.96倍。华为昇腾950系列芯片支持多类型低精度计算格式,在控精度的前提下降低内存占用、提升计算效率,并针对性优化专家模型访存短板;寒武纪则依托自研软件栈与开源推理框架,实现新模型快速适配落地,持续优化通信与推理链路。模型与硬件的深度协同,能够有效缩短适配周期、降低单位Token成本、提升算力有效产出,成为国产算力突破升级的核心路径。

相关公司

寒武纪:公司主营AI芯片研发与配套软件平台搭建,是国内算力供给端核心硬件厂商,具备完善的模型适配与算力优化服务能力。公司已完成DeepSeek、通义千问、腾讯混元等多款国内主流大模型的适配工作,尤其实现DeepSeek V4版本的首日快速适配,充分体现出公司底层软件栈成熟、模型迭代跟进速度快的核心技术优势。经营层面,公司2025年实现营收64.97亿元、净利润20.59亿元,顺利实现扭亏为盈,2026年一季度营收同比大幅增长159.6%,经营基本面持续向好,整体业务增长具备综合性支撑,业绩提升来源于公司整体业务协同发力,并非单一模型适配或Token需求增长所能简单归因。

海光信息:公司同时布局通用CPU与AI加速DCU双产品线,具备稀缺的芯片系统级协同优化优势,硬件架构适配性较强。公司已完成365款主流大模型的适配工作,依托自研HSL互连技术持续优化CPU与AI加速器之间的通信效率,有效降低数据传输延迟、提升整机协同算力。经营层面,公司2025年营收143.77亿元,同比增长56.92%,2026年一季度延续高增长态势,整体经营成长性突出。需要注意的是,公司模型适配数量行业领先,但模型适配能力仅为技术基础,最终商业化落地成效、业绩兑现能力,仍取决于后续行业实际部署规模与真实算力调用体量。

000***:作为国内AI服务器与算力系统解决方案龙头企业,公司核心价值体现在算力系统集成与全链路优化能力,可整合CPU、GPU、存储、高速互连等各类硬件资源,通过底层系统架构优化有效提升整体算力利用率,精准适配当下算力从硬件堆叠向系统效率升级的行业趋势。公司液冷服务器业务实力行业领先,连续四年稳居国内市场份额首位,能够适配高功耗、高密度AI算力集群的散热需求,契合超节点规模化落地的发展方向。公司2025年实现营收1647.82亿元,同比增长43.3%,营收规模稳步扩张,但利润增速相对滞后,直观反映出当前算力硬件制造行业竞争激烈、盈利承压的行业现状。

688***:公司深耕流程工业领域,主营工业自动化管控与工业AI落地解决方案,是大模型技术向实体产业垂直落地的代表性企业,核心将通用大模型能力适配至化工、石化等流程工业场景,落地应用覆盖设备智能管理、生产精准控制、企业经营数据分析等核心工业环节。工业AI商业化落地逻辑区别于通用大模型,行业持续性收入不仅取决于试点项目数量,更核心在于产品能否切实帮助工业客户降低生产成本、减少设备故障、提升整体生产运营效率。公司2025年实现营收80.73亿元、净利润4.41亿元,基本面稳健,后续工业AI业务的价值兑现,仍需观察各类试点项目能否成功转化为客户长期落地、持续付费的标准化产品服务。

... ...

扫码回复“8-大模型”查看行业公司介绍,并可免费诊股,还可咨询实操指导服务!

IMG_257

作者:于晓明 执业证书编号:A0680622030012

责任编辑:hec

免责声明:陕西巨丰投资资讯有限责任公司(以下简称"巨丰投顾")出品的所有内容、观点取决于市场上相关研究报告作者所知悉的各种市场环境因素及公司内在因素。盈利预测和目标价格的给予是基于一系列的假设和前提条件,因此,投资者只有在了解相关标的在研究报告中的全部信息基础上,才可能对我们所表达的观点形成比较全面的认识。
巨丰投顾出品内容仅为对相关标的研究报告部分内容之引用或者复述,因受技术或其它客观条件所限无法同时完整提供各种观点形成所基于的假设及前提等相关信息,相关内容可能无法完整或准确表达相关研究报告的观点或意见,因而仅供投资者参考之用,投资者切勿依赖。任何人不应将巨丰投顾出品内容包含的信息、观点以及数据作为其投资决策的依据,巨丰投顾发布的信息、观点以及数据有可能因所基于的研究报告发布日之后的情势或其他因素的变更而不再准确或失效,巨丰投顾不承诺更新不准确或过时的信息、观点以及数据,所有巨丰投顾出品内容或发表观点中的信息均来源于已公开的资料,我公司对这些信息的准确性及完整性不作任何保证。巨丰投顾出品内容信息或所表达的观点并不构成所述证券买卖的操作建议。
相关内容版权仅为我公司所有,未经书面许可任何机构和个人不得以任何形式转发、翻版、复制、刊登、发表或引用。

建议意见反馈 jiangy@jfinfo.com
展开
财经头条声明:所载内容仅为传递信息目的,非本站观点,亦非投资建议。据此操作,风险自负。 商务合作:app@feheadline.com
打开“财经头条”阅读更多精彩资讯
APP内打开