您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 未知机构:《中金推理产业链深度报告:技术及测算|研报》-发现报告

中金推理产业链深度报告:技术及测算

2026-08-24 未知机构 Dawn
中金推理产业链深度报告:技术及测算

猜你想问

这份报告主要讲了什么内容?

这份报告分为技术篇与测算篇,技术篇梳理了推理优化的四层技术架构,包括模型架构层、推理算法层、推理引擎层和异构调度层,测算篇则量化了各技术的降本增益,为理解AI商业化提供了前置模块。报告详细分析了每层技术架构的功能和作用,以及如何通过优化这些技术来降低推理成本,提升效率。

推理优化技术架构有哪些关键点?

推理优化技术架构分为四层:模型架构层通过混合专家(MoE)、稀疏注意力、MLA/GQA等技术压缩计算量和K/V缓存;推理算法层通过量化和投机解码等技术降低数据位宽和提升生成效率;推理引擎层通过K/V缓存管理、PD分离、多并行技术等提升单位GPU产出;异构调度层通过芯片适配、资源池化、副本放置等技术提高硬件利用率。

报告对推理产业链参与者有哪些分析?

报告分析了模型厂商、云厂商和第三方推理平台。模型厂商如DeepSeek、Kimi等通过自研推理架构和Codesign协同设计提效;云厂商通过公有云流量向头部集中和规模效应提升硬件利用率;第三方推理平台如TogetherAI、硅基流动等聚焦引擎优化,长期或向软硬协同延伸。

报告如何测算推理成本?

报告提出了基准公式:每百万Token成本=GPU小时价格×换算系数÷(单卡理论吞吐×算法增益×引擎工程达成率×集群利用率)。通过这个公式,报告量化了模型架构优化、算法优化、引擎优化和集群利用率提升带来的降本效果,其中模型架构优化降本最高可达80%,引擎优化降本超80%。

报告提示了哪些风险?

报告提示了技术迭代快导致特定模型/硬件优化成果易贬值的风险,产业链价值分配模式可能因收费方式变化而调整的风险,GPU成本和Token价格变化压缩中间环节毛利的风险,以及量化、投机解码等效果受模型、任务、硬件约束的风险。