自主操作:AI 系统现在能够以一定程度的自主性行动。这些更高级的系统,通常被称为 AI 代理,现在可以执行一些多步骤任务,使用工具,并在较少人工监督的情况下运行,尽管在现实环境中的复杂应用中性能仍然有限。
AI 辅助编码:AI 系统在特定基准上的编码能力得到了快速发展。通用 AI 系统现在在一些需要人类超过两小时才能完成的编码任务上实现了 50% 的成功率。大多数软件开发人员报告说他们与 AI 助手合作,尽管在更现实的环境中,AI 编写的软件可能具有更高的维护成本,生产力效应尚不明确。
现实工作任务的性能差距: 尽管 AI 系统在标准化评估中不断改进,但它们在更现实的工作任务上的成功率仍然较低,这突出了基准性能与现实世界有效性之间的差距。
AI 在科学领域的应用: 科学家越来越多地使用 AI 系统来支持各种研究任务。初步证据表明,研究人员使用 AI 助手来优化算法(例如 AlphaEvolve 方法)、编制文献综述和帮助设计实验室协议,特别是在计算机科学和生命科学领域。然而,实践各不相同,这些系统仍然是人类研究人员的补充,而不是替代品。
风险影响
生物风险: 初步评估表明,AI 系统可能很快就能帮助用户开发生物武器,尽管证据基础有限且存在争议。这可能包括提供获取和构建病原体的说明、简化技术程序以及排除实验室错误。虽然生物武器开发的协议可能已经公开在线,但 AI 系统可以提供更详细、量身定制或更易于获取的信息。例如,一项研究表明,当前的语言模型在排除病毒学实验室协议方面比 94% 的受试者专家做得更好,这得益于病毒学家认为罕见的知识。这种建议可以帮助专家和新手,并且许多当前的防护措施都可以被绕过,例如如果用户声称他们需要这些信息进行合法研究。
网络攻防: 英国国家网络安全中心预测,到 2027 年,通用 AI 系统几乎肯定会(95-100% 的信心)使网络攻击更有效、更高效,同时也为防御工具提供了机会。评估表明,AI 系统可以发现和修复可利用的软件漏洞,并与顶尖人类团队在黑客比赛中竞争。结果,在披露后解决软件漏洞的时间窗口现在已经缩短到几天,并且随着 AI 的进步,这种情况可能会进一步缩短。净效应是 AI 可能会使大规模网络攻击的成本更低、速度更快。与此同时,AI 系统在独立执行完整攻击序列而不需要人工指导方面的能力仍然存在重大缺陷,这使得人机协作是近期的首要威胁。
劳动力市场风险: 尽管许多工人已经开始使用 AI,但 AI 系统的劳动力市场影响仍然有限。证据表明,在工作场所的采用有所增加,迄今为止 aggregate 就业没有受到重大影响,尽管已经记录到对特定人群的针对性影响。
监控和控制: 一些初步研究表明,在某些情况下,AI 系统可以检测到它们处于评估环境中并相应地改变它们的行为。这给监控和控制这些系统带来了挑战。在评估环境中表现出的策略性行为使得更难预测 AI 系统在部署后的行为。这可能会增加用户、AI 公司或其他行为者失去对 AI 系统控制权的风险。
研究结论
AI 能力的提高,包括推理能力和自主操作,为 AI 风险管理提出了新的考虑因素。逐步解决问题的技术、扩展的操作范围和改进的工具使用在高风险环境中为监督创造了新的挑战。
AI 能力正在提升生物和网络威胁,同时也加强了防御。领先的模型协助执行与协助创建生物武器相关的各种任务。国家当局预测,AI 将使网络犯罪在未来几年变得更加容易和有效。一个关键的研究问题是改进的能力将使攻击者受益更多还是防御者受益更多。
尽管许多工人已经开始使用 AI,但 AI 系统的劳动力市场影响仍然有限。证据指向在工作场所的采用有所增加,迄今为止 aggregate 就业没有受到重大影响,尽管已经记录到对特定人群的针对性影响。