大模型厂商AR增长驱动因素
- Agent应用爆发: Agent及自动化工作流场景下,单次任务的token消耗量远高于传统聊天场景,预计将贡献大模型厂商AR的50%~60%增量。
- 多模态场景: 视频生成、实时语音交互等多模态场景对token消耗量大,且能提升客单价,拓宽应用场景,贡献AR增量。
- 模型能力提升: 模型能力突破带来溢价,提升token销售单价和量,例如Anthropic的Cloud系列模型频繁更新,推动AR增长。
算力供给瓶颈
- 结构性分化: 绝对算力不缺,但推理场景下缺的是高带宽、高显存容量的优质推理算力,高端GPU供应紧张。
- 集群规模限制: 头部模型厂商需要万卡级别集群支撑Agent应用,但具备此能力的厂商国内较少。
- 国产化替代: 美国对高端GPU出口管控加强,国产GPU算力效率和稳定性仍需提升。
Token分成模式
- 算力方优势: 算力方掌握稀缺GPU资源,决定基础服务价格和分成比例,承担硬件CAPEX和电费等成本。
- 模型方收益: 模型方让渡大部分token收益,将重资产风险转移,专注模型研发和生态拓展,并通过分成获得收益。
- 分润机制: 通常采用保底租金+超额部分分成的模式,算力方和模型方根据成本结构决定分成比例。
- 净利率提升: 相比传统租赁模式,token分成模式下净利率有望提升至30%~44%,主要源于成本优化和收入结构升级。
算力租赁行业景气度
- 需求持续性增强: Token分成模式下,算力租赁需求与模型商业化直接挂钩,具有更强的持续性和可预测性。
- 商业模式升级: 算力租赁行业从卖资源转向卖服务,商业模式升级获得市场认可。
- 大模型厂商反哺: 大模型厂商新增AR中超过一半将转化为算力CAPEX,推动算力租赁行业高景气度。
未来展望
- 拿卡难度: 美国对高端GPU出口管控可能持续,拿卡难度短期内可能保持高位。
- B卡价格: 短期内B卡价格仍有上涨空间,其性价比仍高于H卡。
- 技术代际更迭: 英伟达B系列H系列等机柜级解决方案若实现50倍推理提升,将对现有token分成模型产生双刃剑效应,可通过商业模式创新和技术适配转化为利润增长机会。
- 国产化替代: 国产GPU算力替代将降低硬件成本,提升token分成模式下的利润空间。