恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
急诊AI决策支持为何越用越没人用?Rambam×梅奥Nature Medicine用DECIDE-AI评估SHAKED多LLM系统:4周采纳率68%跌至30%,班次负荷每增1小时使用概率降28%
首页
资讯中心
/
急诊AI决策支持为何越用越没人用?Rambam×梅奥Nature Medicine用DECIDE-AI评估SHAKED多LLM系统:4周采纳率68%跌至30%,班次负荷每增1小时使用概率降28%
急诊AI决策支持为何越用越没人用?Rambam×梅奥Nature Medicine用DECIDE-AI评估SHAKED多LLM系统:4周采纳率68%跌至30%,班次负荷每增1小时使用概率降28%
发布时间:2026/8/23 22:46:11
一、研究背景急诊科是医院里最紧绷的场所患者来去匆匆病情急、决策时间短医生要在几分钟内完成分诊、检查、会诊、用药等一系列判断。正因如此急诊被普遍视为人工智能临床决策支持CDSS最有价值的落地场景之一——但「有价值」和「真的被医生用起来」之间一直隔着一道很少有人量化的鸿沟 DOI: 10.1001/jama.2023.22295。过去几年急诊AI研究大多停留在回顾性验证或离线模拟任务上真正把系统装进急诊、让真实医生在真实班次里用的前瞻性证据少之又少。而即便系统被部署医生用不用、愿意在什么场景用、越用越少还是越用越多这些「人」的问题往往被算法指标的漂亮数字盖了过去。2026 年 8 月 19 日以色列海法 Rambam 医疗中心神经科联合以色列理工学院、美国波士顿贝斯以色列女执事医疗中心、梅奥诊所团队在 Nature Medicine 发表研究对基于多个大语言模型的急诊决策支持系统 SHAKED 做了 DECIDE-AI 第 1 阶段前瞻评估第一次把「医生到底愿不愿意用」这个问题摆到了台面上 DOI: 10.1038/s41591-026-04601-5。二、研究创新点这项工作的价值不在算法有多新而在于它在真实世界里问了一个真问题有三点鲜明设计第一采用 DECIDE-AI 第 1 阶段前瞻评估框架。该框架是专门为临床AI早期评估制定的报告指南 DOI: 10.1038/s41591-022-01772-9要求系统在真实临床环境中接受检验而非只在离线数据集上打分。研究把 SHAKED 真正部署到三级急诊科在 4 周、两个平行单元中真实运行。第二把「医生采纳行为」当核心结局。以往研究盯着准确率、灵敏度这项研究却把医生在真实工作流里「用还是不用」「在哪个环节用」「随班次时间怎么变化」作为主线索直接测量临床AI落地的头号障碍——人。第三多 LLM 架构加事件驱动管道。SHAKED 由多个大语言模型构成通过事件驱动管道自动从电子病历抓取数据、生成结构化病史与临床洞察再经带检索增强生成RAG的聊天界面供医生调用。三、技术原理SHAKED 的整体架构围绕「临床事件触发—数据加工—知识增强—对话交互」四段展开事件驱动管道临床事件从电子病历EMR触发一条由事件服务器Event Server与调度器Scheduler协调的流水线自动拉取患者数据生成结构化病史摘要与自动化临床洞察写入中央的 SHAKED 数据库RAG 知识模块临床医生通过聊天界面与系统交互背后的检索增强生成模块实时从知识库调取证据为回答背书、抑制大模型幻觉多 LLM 支撑系统并非单一模型而是基于多个大语言模型协同工作部署在安全的医院级基础设施AWS Bedrock上。这套设计把「病历数据」和「医学知识」拧成一股绳让医生在急诊的紧张节奏里用自然语言就能追问决策依据。四、实验结果研究在 4 周内共分析 1,138 名患者分成两个平行单元干预单元Wing An584使用 SHAKED对照单元Wing B沿用常规轮转。核心结果一栏表指标结果统计量临床采纳率从 68% 降至 30%4 周内持续下滑工作量相关脱离每增加一个班次小时使用概率下降OR0.7295% CI 0.62–0.83放射会诊使用偏好医生更倾向在放射会诊中使用OR2.9895% CI 1.58–5.63输出质量100 份抽样中 99 份临床恰当99/100不良事件未检出—急诊住院时长两翼无差异均 4.9 小时P0.99会诊周期时间缩短趋势但不显著−9.4 分钟P0.077这几个数字拼出的图景耐人寻味系统的「质量」其实很好——100 份抽样输出里 99 份被专家评为临床恰当且没有检出任何不良事件但「用量」却在持续萎缩采纳率从最初的 68% 一路掉到 30%。更关键的是脱离的诱因指向工作负荷——每多上一个班次的小时医生使用系统的概率就显著下降OR0.72。而医生也并非一律排斥在放射会诊这类信息检索密集型场景里他们反而更愿意用OR2.98。也就是说算法没问题、输出没问题卡住的是「人有没有余力和意愿去用」。五、应用前景这项研究对临床AI落地给出的启示比一份漂亮的准确率更有分量其一落地难题从「算不准」转向「用不动」。急诊医生在高峰班次里连喝口水的时间都紧张再好的决策支持若每次调用都要额外点几下、读一段就很容易被搁置。AI 系统要做的不是「更聪明」而是「更省事、更顺滑地嵌进工作流」。其二场景选择比全面铺开更重要。医生在放射会诊等特定环节明显更愿意用 SHAKED说明急诊AI应当「有的放矢」先在医生真正需要、且能即时获益的高频场景扎根而不是一上来就追求全流程覆盖。其三为后续随机试验提供了设计依据。作者明确指出这些发现可用于指导随机试验设计但尚不足以支撑 AI 决策支持在急诊的临床部署——这是一份诚实的、克制的前瞻性结论。需要客观指出本研究是第 1 阶段的早期前瞻评估主要结局聚焦采纳行为而非患者层面的硬终点会诊周期时间的缩短也未达统计学显著。但它把「持续临床参与」这个此前被低估的变量正式写进了急诊AI落地的账本里。六、结论急诊不缺聪明的AI缺的是「能持续用下去」的AI。SHAKED 的这项 DECIDE-AI 第 1 阶段前瞻评估用 1,138 名患者、4 周真实部署的数据说清了一个反直觉的事实在算法精度之外医生的持续参与意愿才是决定临床AI能否真正落地的关键变量 DOI: 10.1038/s41591-026-04601-5。它没有宣称AI改变了患者结局却为「AI该以何种姿态进入急诊」提供了一个更清醒的起点——先解决「愿不愿用」再谈「准不准」。本文基于 2026 年最新论文/开源项目的独立解读立场与原作者无关仅作技术交流。论文原文信息链接急诊AI临床决策支持为何越用越没人用SHAKED多LLM系统4周前瞻评估揭示采纳率从68%跌至30%参考文献Leibovitch L, Ahituv A, Gorenshtein A, et al. Prospective evaluation of a large language model clinical decision support system in the emergency department.Nature Medicine, 2026. DOI: 10.1038/s41591-026-04601-5Vasey B, Nagendran M, Campbell B, et al. Reporting guideline for the early-stage clinical evaluation of decision support systems driven by artificial intelligence: DECIDE-AI.Nature Medicine, 2022;28(5):924–933. DOI: 10.1038/s41591-022-01772-9Jabbour S, Fouhey D, Shepard S, et al. Measuring the impact of AI in the diagnosis of hospitalized patients: a randomized clinical vignette survey study.JAMA, 2023;330(23):2275–2284. DOI: 10.1001/jama.2023.22295