推理需求高增叠加算力紧缺,大模型厂商、云厂商与第三方服务商都在追求更高的推理效率。在厘清推理优化原理之后,市场更关心:不同技术对成本下降的定量影响究竟有多大?这条产业链上都有哪些参与者,各自价值几何?中金公司《Token启示录(五):推理产业链深度——测算篇》尝试给出答案。
报告的核心判断是:在硬件价格既定时,单位Token成本由单卡理论吞吐、算法增益、推理引擎工程达成率和集群利用率四项共同决定。模型架构与芯片设定理论成本边界,量化、投机解码等算法进一步放大有效吞吐,推理引擎与集群调度则决定理论收益能兑现多少。单项优化很难形成持续的成本优势,覆盖模型、算法、引擎与硬件的协同设计(Co-design)才是长期成本优势的来源。
一、市场格局、价值分成与经济效益
参与者众多,各环节群雄逐鹿
随着大模型从聊天工具向搜索、编程、客服和企业工作流渗透,调用主体也从个人用户扩展到自动运行的软件和智能体(Agent);长上下文与推理模型执行更长的思维链,进一步推高推理需求。推理产业链上,除硬件厂商外主要有八类参与者,各环节毛利率主要取决于推理优化能力、硬件利用率、硬件采购成本和产品定价权。
- 模型厂商:掌握架构、权重、训练数据与评测反馈,能把MoE、注意力机制、投机解码、低精度设计前移到研发阶段,具备模型与推理系统协同优化的天然优势。当模型智能水平差距拉大时,模型能力支撑API定价分化;当开放模型能力趋同时,成本控制与渠道分发的重要性上升。
- 超大规模云厂商:掌握算力采购、网络存储、企业客户和应用生态的全栈资源,优化收益通过提升集群利用率、带动云资源消费和增强客户黏性兑现。据IDC,2025年中国公有云MaaS市场按调用量计算,火山引擎占据近半份额,其次是阿里云、百度智能云、硅基流动和移动云;私有化部署市场集中度更低,传统政企出于数据安全与合规仍优先选择私有部署。
- 海外Neo cloud与国内算力租赁厂商:靠GPU资源和快速交付切入。算力紧张阶段,高性能集群与长期容量合同支撑收入;中长期供给释放后,竞争优势回归利用率、融资成本和软件附加值。
- 中立推理优化平台:优势在跨模型、跨芯片和客户专用负载的管理。长期价值取决于能否向上参与模型适配、向下深入Kernel与硬件,把无服务器推理流量转化为专属端点、预留容量、软件许可或私有部署收入。
- 国内异构算力平台:受益于多类芯片并存与私有部署需求,芯片适配、资源池化与跨集群调度具备明确商业价值;随着适配周期缩短、软件订阅及运维收入占比提高,有望形成软件型毛利。
- 多模型API聚合平台:控制模型分发、统一计费和请求路由,价值主要来自降低接入成本、提高调用便利度。
- 芯片厂商:通过硬件销售、软件生态和开发者锁定承接价值。低精度计算、显存带宽、互联与专用算子决定理论上限,编译器、Kernel库和主流框架支持决定客户实际能调用多少性能。
- 应用厂商:是推理效率改善的重要承接方。成本下降可支撑更高调用频率、更长上下文和更复杂的Agent工作流,并打开实时语音、代码生成、自动执行等新产品形态。
从技术维度看,推理优化能力可理解为”四层模型与系统级优化+底层硬件”:模型架构设定计算、显存与通信的先天边界;量化、投机解码等算法压缩数据搬运与串行生成轮次;推理引擎负责请求调度、KV Cache、Kernel及跨卡执行;异构调度完成芯片适配、资源池化、放置与路由;硬件则决定可用精度、显存带宽和互联上限。
价值分成:不同服务模式分层略有差异
一是海外闭源模型厂商已形成一定模型溢价,国内模型毛利仍在爬坡;二是国内Token工厂面临较重的折旧与算力成本压力,而海外推理优化平台的专属推理端点相较纯GPU集群租赁定价更高,托管引擎、容量保障和运维具备技术溢价;三是新云靠GPU资源和高性能集群交付切入,短期受益于算力紧缺与价格上涨;四是大型云厂商凭借成熟客户结构、较高利用率和交叉销售,毛利率通常处于较高水平。总体而言,短期规模扩张可摊薄固定成本,中长期超额利润仍要靠把技术效率转化为更低的单位Token成本和更稳定的软件服务溢价。
经济效益:既要算单位Token成本,也要算单位任务成本
SemiAnalysis开源、厂商中立的基准工具InferenceX持续测量不同芯片与软件栈的推理性能。报告基于近期2478条测试数据统计发现:即便固定模型与芯片,单卡Token吐出量的离散度仍高达两个数量级。以样本量最大的模型D为例,其在B200上每卡吐出量从152 token/s到14949 token/s不等,对应每百万Token成本0.04~3.3美元;模型A在GB200上也呈现339~12116 token/s的宽幅分布。差异一方面来自推理优化,另一方面来自并发、输出长度与时延约束——高并发、长输出、宽松时延下吞吐逼近上限,低并发或严苛TTFT/TPOT约束下吞吐迅速回落。
算力采购正快速向新代际集中。模型D每卡吐出量均值由H100的850 token/s、H200的1233 token/s,提升至B200的3916、GB200的4586 token/s,提升约3~5倍,而价格涨幅低于效率涨幅,带动每百万Token成本下降。同类硬件在云厂商、新云、租赁、自建等不同获取形式下成本差异也很大。
报告特别强调:人们真正想买的是”智能”而非”Token”,因此降低任务Token消耗量的重要性不低于降低单位Token成本。根据Artificial Analysis对不同模型和优化厂商的单位任务完成成本测算,除了通过推理优化压低单价,减少完成任务所需的Token数量同样关键,而当前市场对前者的关注远多于后者。
二、成本优化幅度测算:四层优化如何层层压低成本
模型架构首先决定单卡理想状态下的理论吞吐上限(Roofline边界);推理算法通过减少计算量、访存量放大有效吞吐;推理引擎决定理论能力被实际系统兑现的比例,即工程达成率η;集群利用率U则决定GPU运行时间中有多少真正转化为有效Token。最终成本由这四项共同决定。
报告的递进式成本瀑布测算显示:在起点假设为稠密400B模型、MHA注意力、Prefill全注意力、权重FP8、KV Cache为FP16、引擎工程达成率η=10%、集群利用效率U=35%的基准情形下,混合推理成本约为44.46美元/百万Token;经过逐层优化后,混合实际成本可降至约0.039美元/百万Token,降幅巨大。测算假设单次请求含32768个输入Token和1000个输出Token,混合理论成本按输入/输出加权后,再除以工程达成率与利用率(η×U)得到混合实际成本,图中每级百分比为相对上一级的降幅而非累计降幅。这一测算直观说明:单一技术领先不足以建立壁垒,唯有覆盖模型、算法、引擎与调度的Co-design,才能持续释放各层优化效果、系统性扩大成本优势。
三、推理优化参与方百舸争流
推理框架原生公司:从开源引擎走向商业化
vLLM、SGLang等开源推理引擎正成为大模型部署的底座,其核心团队纷纷设立独立公司承接研发、交付与生态:Inferact以vLLM为基础,向跨模型、跨硬件、多节点部署的通用推理层演进;RadixArk以SGLang为核心,向强化学习、后训练与大规模生产部署延伸。这类公司以”开源引擎+商业公司”模式,把性能优化、硬件适配、调度与可靠性能力产品化,价值边界从单一推理引擎扩展到覆盖推理、后训练和生产基础设施的更完整AI Infra层。
第三方推理优化平台与Token工厂
商业模式上,这类平台把底层算力转化为按Token、GPU时间或确定性容量购买的生产服务,核心优化指标是吞吐、时延和GPU利用率,服务于客户的SLO与预算。它既不同于纯算力租赁,也不同于只提供模型权重或API的模型厂商,价值在于用软件工程提高每单位算力的有效Token产出,并把模型适配、调度、监控和版本治理封装为服务。主流交付形态有三种:无服务器推理服务按输入/输出Token计费、共享算力池、灵活低成本,适合开发者和中小企业试用切换;专属实例在公有云上为客户预留算力,按时长或用量计费,性能和容量更稳定;私有部署则基于客户自有算力,以订阅或永久许可加维护费形式服务大型客户,满足数据安全、国产芯片适配和本地运维要求。
国内外差异上,海外软硬件生态相对集中,平台重在成熟栈上做吞吐、时延和利用率优化,并以公有云服务为主,客户多是AI原生公司和软件公司,例如Fireworks AI为Cursor、Notion等提供稳定的专属推理资源;国内市场海外GPU与多种国产芯片并存,平台除提效外还要承担芯片适配、多芯片调度和本地化交付,异构适配既是技术重点,而大客户往往自有算力、看重数据安全,更倾向私有部署——以硅基流动为例,2025年前五大客户贡献45.0%收入,其中四家采购本地部署、一家采购专属实例。异构适配能否沉淀为可复用能力、让新增模型与芯片的边际适配成本持续下降,是其长期壁垒所在。
模型厂商:在架构层内化推理能力,加速商业化变现
大模型厂商正把推理效率内化为模型竞争力:DeepSeek以多头潜在注意力(MLA)压缩KV Cache、用DeepSeekMoE激活部分专家降低计算量,并推出DSpark投机解码,通过并行草稿生成、顺序依赖恢复和动态验证长度提升单用户速度;阶跃星辰参与并行树投机解码(JetSpec)研究,提升低并发单用户场景生成速度;Kimi以Mooncake为核心,按3∶1混合KDA与Gated MLA,用固定大小递归状态降低长上下文缓存开销;MiniMax以MSA稀疏注意力降本;智谱则通过收购中科加禾向下整合异构算力软件栈。
开源模型厂商也在加速探索变现:2026年7月,月之暗面与中国软件国际深度合作,联合打造行业智能体与数智方案,并基于Token消耗及衍生收入分成,中软国际自建行业算力中心优先保障其需求;月之暗面为K3、MiniMax为H3相继设置商业化授权门槛——企业MaaS业务收入或商业产品月活/月收入达到一定规模(约2000万美元量级)须另行签署商用协议并显著标注模型名称。这意味着开源厂商在扩大影响力的同时,正积极把模型能力转化为收入。
云厂商:以全栈产品发挥规模效应
云厂商依托大型数据中心、GPU及自研芯片,把分散算力汇集为资源池,既可以封装为按Token计费的标准化MaaS,也能为稳定高并发需求提供预留吞吐、专属实例和GPU租赁。其天然优势在于客户与产品协同:企业的数据、存储、数据库、安全与应用本就在云上,同环境调用模型可减少迁移、集成与合规成本,并直接复用身份认证、监控、计费和采购体系,再通过模型API与数据平台、Agent工具、行业方案交叉销售。海量请求还能提升调度效率、降低容量冗余,形成”流量—优化—更优价格—更多流量”的正向循环,把GPU规模转化为持续下降的单位Token成本。
四、投资建议:关注具备Co-design能力、已建立数据反馈闭环的厂商
报告把主要参与者归纳为三类,禀赋各异:中立推理优化平台胜在技术中立与围绕客户SLO的联合优化,在算力紧缺背景下,其异构调度积累有望成为产业链卡位的独特竞争力;大模型厂商掌握架构、训练、权重与评测,能在模型层直接做推理适配并随版本同步调整策略,模型—系统协同优势天然;云厂商则具备全栈整合能力与基础设施规模,可把自有云业务适配大模型后以Token服务出售,把算力规模转化为Token经营优势。
报告认为,Co-design是维持推理优化能力与时俱进的核心——把优化前移到模型或芯片设计阶段,用真实生产流量形成反馈闭环,并通过联合适配缩短新技术进入生产的周期。在模型快速进步、阶段性领先难以长期维持的环境下,跨越模型、引擎、调度与硬件的Co-design基础,才是各层参与者持续领先的关键。
五、风险提示
- 技术迭代风险:大模型架构、推理算法和开源框架快速演进,若厂商技术对特定模型或硬件依赖较强,相关投入可能因模型换代、能力开源或标准变化而加速贬值。
- 商业模式变化风险:若订阅制、广告、交易佣金、按结果付费、软硬件一体化或垂直应用等模式快速发展,模型调用量、定价方式与产业链议价关系都可能改变。
- 成本上升风险:若高端GPU持续紧张,或电力、存储、网络与数据中心租金上涨,而Token价格因竞争继续下行,推理商或难以及时转嫁成本,毛利率承压。
- 优化技术演进风险:量化、投机解码、模型压缩等若参数设置不当,可能引发精度下降、拒绝率上升、长文本稳定性减弱等问题,增加评测、调参与故障回退成本。