IT 运营已超出其原有模型的承载能力。企业监控着数万个指标,每日处理 TB 级日志和数千个警报,同时管理着跨越本地数据中心、多云环境和新兴 AI 工作负载的日益复杂的架构。尽管拥有大量遥测数据,但许多团队仍需通过客户反馈才能了解故障,这种可见性差距已不可接受。近期 CrowdStrike、Cloudflare 等公司的重大故障表明,小问题可能迅速波及行业、中断日常生活,并给公司带来数十亿美元损失。
AI 首次可观察性需要更全面的解决方案,必须涵盖应用程序、身份、支付、API 和用户体验所在的互联网本身,这是业务弹性的关键所在。这种混合基础设施可观察性、互联网性能监控和数字体验监控的融合,才是自主 IT 的真正开端。领导者需要转变思维。
解决方法并非更多工具或人力追逐警报,而是采用新的运营模式,将 IT 从被动响应转变为预测性,从补丁修复转变为自我修复。这不再是理论,而是现实。统一数据使 AI 得以工作,AI 则通过减少事件数量来证明持续投资的合理性,这种循环已在最高绩效组织中形成。
调查数据显示,五大力量正在加速这一转变:
- 成本压力推动整合:96% 的 IT 领导者预计未来 12-24 个月可观察性支出将保持稳定或增长(62% 预期增加)。可观察性已成为受保护的、战略性的基础设施,因为保护正常运行时间对业务交付至关重要。
- 整合是优化策略:84% 的组织正在或考虑整合工具。41% 正在积极整合,43% 在评估。整合不再仅仅是成本节约,而是降低成本、提高服务交付和建立 AI 所需统一数据基础的战略加速器。工具碎片化导致运营和财务影响巨大,如 2024 年 CrowdStrike 故障估计给财富 500 公司造成超过 50 亿美元损失。
- 平台忠诚度让位于敏捷性:67% 的 IT 领导者表示,组织可能在 1-2 年内更换可观察性平台。主要触发因素包括新公司倡议(27%)、安全合规要求(22%)、替换过时工具(19%)、重大故障暴露监控差距(13%)和常规技术更新周期(11%)。
- 当前工具无法提供可操作的洞察:仅 41% 的 IT 领导者对其平台从收集的数据中提取有用洞察的能力表示满意。59% 的组织拥有大量遥测数据但缺乏将数据转化为行动和预防的工具。具体痛点包括缺乏高级洞察(38%)、告警疲劳(36%)和集成差距(39%)。传统工具难以处理容器化环境的高基数数据、跨系统关联指标、在分布式架构中识别根本原因以及减少告警噪音。
- AI 采用正成熟,但多数组织有巨大发展空间:仅 4% 的组织完全利用 AI 跨 IT 运营。多数(49%)仍在有限环境中试点或实验 AI,22% 尚未采用。62% 的组织已开始实施 AI 但尚未在 IT 中全面运营化。领导者希望 AI 提供行动导向的自动化(52% 优先选择加速根本原因分析),并要求有政策驱动、审批流程、与现有治理流程集成以及可解释性。
这些力量形成了一个相互强化的循环:受保护的预算重新启动循环,整合创造统一数据基础,AI 能力提供可衡量的成果,成果证明持续投资合理性,而工具不满足需求则创造变革紧迫性,平台忠诚度下降则消除变革阻力。
该研究为 IT 领导者提出了明确要求:自主 IT 已不再是未来愿景,而是 2026 年的运营要求。组织面临抉择:继续将可观察性管理为一系列断开连接的工具和手动流程,还是果断转向能够实现 AI 驱动的自主运营的统一平台。行动窗口现已开启,但不会无限期存在。前进之路需要三个连续步骤:
- 跨所有层统一可见性:通过平台整合建立基础,这是 AI 有效的先决条件。
- 在交付链中全面运营化 AI:实施提供可衡量成果的 AI 能力,从事件响应自动化和根本原因分析开始,重点关注提高业务弹性、减少 MTTR、降低告警噪音并提供可解释性。
- 采用带约束的自主运营:引入能够跨内部和外部系统行动和主动解决问题的自主 AI,同时保持基于政策的治理和可解释性。部署预测能力以在影响用户之前预防问题,实施基于政策的控制和工作流的自动修复,并与现有 ITSM 和变更管理系统集成以保持合规。
自主 IT 比想象中更近。执行这一路径的组织将通过提高可靠性、加快创新周期和减少运营成本来获得竞争优势。而延迟行动的组织将发现自己用不足够的工具管理日益复杂的架构,而竞争对手则已实现自主运营。