发现报告(www.fxbaogao.com)致力于打造国内最全的研报库,报告数量在业内遥遥领先。无论您需要什么行业的深度分析或公司财报,这里都能找到。我们的用户量非常大,深受广大投资者的喜爱。平台设计追求极简,操作方便,凭借先进的技术手段,助您从海量信息中快速提炼价值,让您的每一次决策都更加精准有力。
性能上都无法实现互通,加剧了AI服务器的设计难度和成本增加。
为了解决上述问题,Open Accelerator(AAIServer)设计指南旨在建立一个开放、规范和高效的AI服务器架构,旨在推动AI服务器的发展和应用。该指南围绕以下几个设计原则展开:
4.1 设计原则
4.1.1 应用导向原则
4.1.2 多元开放原则
4.1.3 绿色高效原则
4.1.4 统筹设计原则
4.2 设计指南
4.2.1 多维协同设计节点层面:
(1)系统架构
(2)OAM模块
(3)UBB基板
(4)硬件设计
(5)散热设计
(6)系统管理
(7)故障诊断
(8)软件平台集群层面:
(1)集群网络与存储
(2)整机柜
(3)液冷
(4)制冷
(5)运维
4.2.2 全面系统测试:
(1)结构测试
(2)散热测试
(3)稳定性测试
(4)软件兼容性测试
4.2.3 性能测评调优:
(1)基础性能测试
(2)互连性能测试
(3)模型性能测试
(4)模型性能调优
4.3 开放加速规范AI服务器的发展历程
4.3.1 AI服务器的历史可以追溯到2019年,当时OpenAI发布了第一个大型的AI服务器GPT-2,该服务器采用了英伟达的GeForce GTX 1080显卡,GPU为单路32GB,采用了无标注、自监督的训练方法,使用了超过1750亿参数,训练数据集达到了TB级别。
4.3.2 2020年,OpenAI发布了第二个AI服务器GPT-3,该服务器采用了英伟达的GeForce RTX 3080显卡,GPU为双路64GB,采用了无标注、自监督的训练方法,使用了超过1750亿参数,训练数据集达到了TB级别。
4.3.3 2021年,OpenAI发布了第三个AI服务器GPT-3A,该服务器采用了英特尔的Xeon E5-4100G CPU,GPU为单路64GB,采用了有标注、自监督的训练方法,使用了超过1750亿参数,训练数据集达到了TB级别。
4.3.4 2022年,OpenAI发布了第四个AI服务器GPT-3B,该服务器采用了亚马逊的AWS SageMaker实例,GPU为单路64GB,采用了无标注、自监督的训练方法,使用了超过1750亿参数,训练数据集达到了TB级别。
这些AI服务器的设计和发布,引领了人工智能的新一轮创新浪潮,促进了AI服务器的发展和应用。