开源大模型时代下先进计算演进的研究报告(2025)
研究背景
- 开源大模型重塑全球AI格局:自ChatGPT引爆全球以来,大模型成为AI产业核心,Meta发布Llama系列开启开源大模型时代,DeepSeek、Qwen、Llama3、Mistral、GLM等开源大模型性能逼近甚至超越闭源模型,改变了全球AI产业格局。开源大模型降低了应用门槛,激发千行百业创新活力,但对底层先进计算基础设施提出挑战。
- 算力需求转变:算力需求从训练驱动转向推理与Agent执行驱动,训练算力每6-10个月翻倍,推理需求两年内可能增长百万倍。
- 国产算力加速崛起:美国对高端AI芯片出口管制下,国产AI算力产业加速崛起,华为昇腾、寒武纪、海光等厂商实现规模化应用,DeepSeek等开源大模型团队在国产算力上实现大规模推理部署。
- 先进计算全面演进:先进计算从单点芯片创新转向系统级、生态级的全面演进,竞争从“芯片为王”变为“系统级竞争”与“生态级竞争”。
研究目的
- 系统梳理产业现状,包括开源大模型生态、先进计算产业链格局、政策环境与典型应用场景。
- 识别关键技术演进路径,包括AI芯片架构、互联网络、推理优化、软件栈协同等维度。
- 梳理国内外标准现状,识别现有标准的覆盖范围与空白点。
- 提出标准化需求建议,涵盖开源大模型与算力适配、先进计算系统与互联、开源软件栈与生态等方向。
- 推动产业协同,促进产业链上下游对话与协作,推动开源大模型与先进计算的深度融合。
研究范围
- 芯片层面:AI芯片架构创新、Chiplet技术、存算一体等新型计算范式。
- 系统层面:异构算力融合、大规模训练集群、先进互联网络。
- 软件层面:开源软件栈、统一编程框架、推理优化引擎。
- 应用层面:开源大模型在国产算力上的迁移、适配与优化最佳实践。
- 生态层面:开源软硬件协同、产业链协作模式与标准化需求。
产业现状与发展趋势
- 开源大模型生态全景:全球开源大模型主要参与者包括Meta(Llama)、Mistral、Google(Gemma)、阿联酋技术创新研究院(Falcon)、国内DeepSeek、阿里巴巴Qwen、智谱AI(GLM)、百川智能(Baichuan)等。开源协议以MIT、Apache2.0为主,开放程度整体呈上升趋势。HuggingFace作为核心基础设施,提供全流程工具链。
- 产业政策与战略导向:国家层面政策鼓励开源大模型生态建设,推动国产算力与开源模型深度适配。地方层面政策通过算力券补贴、智算中心建设等措施构建良性生态。行业自律方面,中国信通院等组织推动建立评测、安全治理等规范。
- 主要应用场景:大规模预训练、微调与持续训练、云端推理服务、边缘与端侧推理、智能体与多模态场景。不同场景对算力规模、互联带宽、内存容量、功耗预算、推理时延等要求差异巨大。
- 产业链格局:上游包括AI芯片、HBM存储、先进封装、光互联等核心硬件环节;中游包括智算中心、云服务与开源软件栈;下游包括开源大模型团队、行业应用与终端。
- 发展趋势研判:算力供需结构持续重构,推理算力成为主要构成;异构算力融合加速;开源软件栈成为关键变量;国产算力进入规模化应用阶段;标准化成为产业协同的关键。
先进计算的主要技术路线
- 演进的总体方向:AI芯片架构创新、异构融合与算力池化、先进互联网络、推理优化技术、开源软硬件协同。
- AI芯片架构创新:Transformer与MoE加速、Chiplet芯粒技术、HBM高带宽存储、存算一体与新型计算范式。
- 异构融合与算力池化:Scale-up与Scale-out的协同演进、软件定义算力、跨厂商异构混训与混推。
- 先进互联网络:节点内互联(NVLink到UALink、CXL)、节点间互联(UEC、InfiniBand与RoCE)、光互联与CPO。
- 推理优化技术:KVCache管理(PagedAttention)、ContinuousBatching、量化与低精度推理、投机解码与并行解码、长上下文优化。
- 开源软硬件协同:编译器演进(从CUDA到Triton/MLIR)、训练框架(PyTorch生态的开放性)、推理框架(vLLM、SGLang、TensorRT-LLM)、国产软件栈的演进路径。
- 关键技术挑战:AI芯片与硬件层面、系统与互联层面、软件栈与生态层面。
标准现状与方向建议
- 国内外标准现状:国际方面包括MLPerf、OCP、UEC、UALink、UCIe、CXL等;国内方面包括TC28SC42、CCSA等。
- 标准空白识别:开源大模型在异构AI算力平台的适配评测规范缺位、大规模训练集群的技术要求与评测方法尚未成熟、先进互联网络的接口与互操作规范有待统一、开源软件栈的统一编程接口与算子规范尚未形成、软硬件协同优化方法论缺乏标准引导。
- 标准化需求识别:开源大模型与算力适配类、先进计算系统与互联类、开源软件栈与生态类。
- 重点标准化方向建议:开源大模型与算力适配类标准、先进计算系统与互联类标准、开源软件栈与生态类标准。
- 下一步工作建议:组建专项标准化工作组、优先启动高紧迫性标准、加强国际标准协同、推动标准与开源协同、建立标准评测与认证体系、持续跟踪产业前沿动态。
DeepSeekV4—开源大模型时代的里程碑
- DeepSeekV4发布概述:V4-Pro(1.6万亿参数)和V4-Flash(2840亿参数)两个版本,原生支持1Mtoken超长上下文,API兼容OpenAI与Anthropic接口标准,商业化定价极具竞争力。
- 关键技术突破:全新注意力机制(DSA+CSA+HCA混合架构)、计算与显存需求大幅下降、训练精度选型(mxFP4)释放国产化信号。
- 对先进计算演进的启示:国产算力深度适配进入新阶段、从CUDA到CANN的软件栈迁移范式样本、开源+国产算力产业链协同新模式。
结束语
开源大模型与先进计算的深度协同是产业演进核心主线,算法创新与硬件能力协同优化、开源生态与国产算力双向赋能、标准化工作与产业实践相互促进,将共同推动中国先进计算产业迈向新的高度。