研究背景与目的
全球医疗工作者短缺问题日益严重,尤其是在低收入和低收入中等收入国家。同时,生成式人工智能(GenAI)的进步为医疗工作提供了新的支持可能性。本研究旨在探讨通用大型语言模型(LLM)是否能够提高不同医疗环境中医生的临床推理能力,并分析使用LLM在医疗环境中的潜在影响。
研究方法
研究采用随机对照试验,在印度尼西亚、肯尼亚和荷兰招募了249名医生,让他们在受控环境下完成4-5个临床病例分析。参与者被随机分配到接受LLM支持或不接受支持 groups。研究使用标准化的临床病例分析,评估医生在没有LLM和有LLM支持下的表现差异。
研究结果
- LLM支持提高临床推理能力:所有三个国家的医生在获得LLM支持的情况下,在标准化临床病例分析中的表现均优于未获得LLM支持的医生。肯尼亚的改善最大(+18%),其次是印度尼西亚(+10.7%)和荷兰(+7.2%)。
- 表现差异存在异质性:尽管LLM支持总体上提高了医生的表现,但两组之间的表现分布存在重叠,并且一些获得LLM支持的医生表现不如未获得支持的医生。这表明仅提供LLM访问权限并不能保证改进。
- LLM使用与表现正相关:更高的LLM使用率与更好的表现相关。在印度尼西亚、肯尼亚和荷兰,高使用率组医生的平均得分分别比低使用率组高16.1、8.4和7.5个百分点。
- LLM对非专科医生的帮助更大:LLM对非专科医生的帮助大于对专科医生的帮助,这表明LLM可能有助于缩小技能差距。
- 医生对LLM的感知:医生普遍不担心LLM会取代他们的工作,并且认为LLM可以提高他们的工作效率。大多数医生认为LLM在诊断方面非常有用,但在病史采集方面也很有帮助。然而,医生也担心LLM的准确性和幻觉风险。
政策建议
- 结构化整合LLM:LLM的集成设计比提供访问权限更重要。应指定允许临床LLM使用的集成架构,并通过独立推理步骤、自动安全检查或明确的合成协议来管理人机边界。
- 投资AI能力发展:应将AI素养和LLM特定技能纳入医学院课程、继续专业发展要求和专科委员会考试中。培训应针对医生报告的最大价值临床任务。
- 缓解自动化偏差:应要求进行记录在案的独立临床推理,并推广高风险决策的验证协议。更新专业行为准则,以指定与AI相关的事故报告和患者沟通的职责。
- 优先考虑公平访问:应投资于连接性、硬件和可互操作的数字医疗基础设施,并明确目标服务欠发达地区和设施。
- 本地化适应和验证:在使用LLM进行临床护理之前,应确保其适应当地临床指南、处方和诊断可用性,并在代表性本地数据上进行前瞻性验证。
- 建立透明的监测和评估机制:应建立监测系统,跟踪使用模式、临床结果、安全事件和分布影响,并建立明确的纠正、撤回或模型重新训练途径。
- 明确责任框架:应在广泛部署之前明确责任规则,将责任适当地分配给AI开发人员、医疗系统部署者和个别临床医生。
- 优先考虑工作中的AI系统的设计、整合和治理中的社会对话:应利用社会对话和集体谈判来预测和管理LLM引起的医疗工作组织、技能要求、监督和绩效管理方面的变化。
研究结论
LLM可以增强临床推理能力,但其有效性取决于在医疗系统中如何实施。政策制定者应优先考虑LLM的结构化整合,作为决策支持工具,并结合有针对性的培训、本地验证和防止自动化偏差的保障措施。还需要投资于基础设施、持续监测、明确的责任框架和包容性治理,以确保公平、安全和适应当地环境的LLM部署。