核心观点
- 英特尔至强® 可扩展处理器助力大模型推理加速:研报重点介绍了英特尔至强® 可扩展处理器在大模型推理场景下的应用,包括第五代和第四代处理器,以及英特尔® AMX、英特尔® AVX-512 等AI加速引擎的作用。多个案例展示了至强® 处理器如何帮助阿里云、百度、中国电信、京东云、金山云等企业提升大模型推理性能,降低成本,并满足不同场景的需求。
- CPU平台在大模型推理中的优势:研报对比了CPU平台和GPU平台在大模型推理中的优劣,指出CPU平台在易获取性、成本、绿色节能等方面具有优势,适合中小模型推理和离线应用。
- 英特尔AI产品组合助力AI应用落地:研报介绍了英特尔AI产品组合,包括英特尔® 至强® 处理器家族、英特尔® AI软件工具组合、英特尔® oneAPI等,并展示了这些产品如何助力AI应用在数据中心、边缘端等场景的落地。
- AI加速实践案例:研报列举了多个AI加速实践案例,涵盖智能推荐系统、自然语言处理、游戏开发、大数据分析等领域,展示了英特尔AI技术在不同行业的应用价值。
关键数据
- 第五代英特尔® 至强® 可扩展处理器相较于第四代提升:
- 整体性能提升42%
- 推理性能提升3.42倍
- 内存带宽提升1.2倍
- 三级缓存提升10倍
- 每瓦性能提升16%
- 阿里云ECS g8i集群可支撑72B参数级别的大语言模型分布式推理。
- 用友NLP应用在基于第五代英特尔® 至强® 可扩展处理器上吞吐性能相较于第四代提升1.2倍。
- 千帆大模型平台基于第四代/第五代至强® 可扩展处理器,Llama-2-7b模型输出Token吞吐提升达175%,首Token时延降低达²。
- 中国电信网络大模型在吞吐量、首字符时延和生成时延方面都与规模相当的开源大模型性能表现一致,在CPU平台上的生成时延均小于100毫秒。
- 京东云新一代云服务器S8,基于第五代至强® 可扩展处理器,新春扫龙字活动模型推理性能提升达5.19倍。
- 金山云新一代云服务器,基于第四代至强® 可扩展处理器,Stable Diffusion 模型推理性能提升达12.52-2.62倍。
- 阿里妈妈推荐系统,基于第五代至强® 可扩展处理器,吞吐性能提升达1.52倍。
研究结论
英特尔至强® 可扩展处理器凭借其强大的AI加速能力和高效的计算性能,为大模型推理提供了理想的算力平台。CPU平台在大模型推理中具有独特的优势,能够满足不同场景的需求。英特尔AI产品组合为AI应用提供了全面的解决方案,助力AI技术在各行各业落地应用。