科大讯飞基础架构网络总监鲍中帅介绍了大模型发展及国产化集群的相关情况。
大模型发展趋势
- 认知大模型的“智能涌现”推动了通用人工智能的技术阶跃,ChatGPT等大模型用户量快速增长,GPT-4用户量突破17亿。
- Gartner预测到2026年超80%企业将使用通用人工智能,中国政策层面也高度重视AI发展,中央经济工作会议强调加快推动人工智能发展。
- 国际大模型产业竞争激烈,科大讯飞坚定投入国产AI芯片软件生态建设,为突破算力卡脖子问题奠定基础。
科大讯飞星火大模型
- 星火大模型是国际领先的图文识别大模型,覆盖更多领域专业符号识别,融合篇章语义文字识别,面向教育、医疗等领域优化。
- 赋能“1+N”认知智能大模型业务产出,集群算力资源利用率达95.7%,5分钟完成千卡诊断。
万卡智算集群运维痛点
- 万卡算力集群系统复杂、规模大、层次多,大模型训练任务对网络要求苛刻,34%的训练中断由网络引起。
- 关键问题包括:RDMA丢包重传机制导致带宽利用率降低(丢包率千分之一时训练效率明显下降)、动态时延提升导致GPU利用率下降、超大规模集群中34%故障由网络引起(光模块问题最突出)。
- 通过联合创新光模块故障预测及分析方法,任务影响环比下降约70%。
万卡集群运维创新实践
- 算力集群运维目标:从“建好”到“用好”,结合指标定义实现持续“提升可训练时长”。
- 智算运维评价指标体系:
- 基于全系统可靠性理论制定指标体系,综合考虑训练平台、软件、算力集群、基础设施等因素。
- 通过明确指标和评价方法从多维度分析运维状况,明确影响训练中断的故障因子。
- 构建指标树和度量模型,量化训练作业流各节点,为制定措施提供依据。
- 稳定网络结构设计:应对网络瘫痪、死锁、拥塞等问题,通过Fullmesh全链路探测、快速路径选择、设备故障最小冗余下业务保活等机制保障稳定性。
- “故障注入”测试:模拟软硬件故障,验证网络内部各类训练任务的稳定性。
- 重新定义AI集群可靠性模型:硬件/软件/算子/通信等持续稳定性问题导致单机多卡集群系统级可靠性“断崖式”降低(单卡可靠性99.99%时10K+集群可靠性仅36.7%)。
智算集群运维痛点及解决方案
- 当前运维痛点:AI训练要求故障快速恢复、跨层跨产品问题难定位、运维技能和人力不足、指标体系和工具需重构。
- 解决方案:
- 组织流程变革:构建符合智算特点的融合型团队,联合二线运维与原厂驻场保障团队协同,原厂三线直达接入,备件管理服务实现小时级派送。
- 赋能与沉淀:建设运维知识库(46个深化设计文档、398个故障场景指导),跨领域培训80+人次。
- 任务级智算运维平台:构建统一运维数据池,利用AI算法跨域数据关系耦合及故障根因定位,故障定位效率缩短至分钟级。
- 3级备件响应体系:匹配智算容灾管理需求,针对设备结构复杂、部件种类多、重量大等问题,实现精准预测与快速响应。