每因智能 · 行业观察

风险预测如何真正进入医疗决策

系统说,这位患者未来一段时间发生病情恶化的概率是三成七。接下来会发生什么?谁看到它,谁去床边,几点之前必须做出处置,做完之后又怎么知道这次处置到底有没有用?
上一篇我们说,医疗 AI 的下一步是从回答问题走向理解时间与风险。但把风险算出来,只是把问题往前推了一格。真正决定一套系统有没有价值的,是这个分数之后的四件事:谁需要干预、何时干预、如何干预、如何验证。这四件事,没有一件属于建模。
一、谁需要干预:阈值是资源分配决定

被广泛部署过的 Epic 脓毒症预警模型提供了一把清楚的尺子。密歇根大学的外部验证显示,在推荐阈值下它的灵敏度约三分之一,同时对将近五分之一的住院患者拉响警报;即便采用每名患者只在首次超过阈值时报警一次这种最省的策略,临床医生仍需评估 8 名患者才能找出 1 例最终确诊的脓毒症。更值得管理者注意的是另一个数字:在它识别出的 2,552 例脓毒症中,当时确实没有获得及时抗生素治疗的只有 183 例,占 7%。也就是说,相对现行临床实践,这套系统能带来增量价值的病例不足十分之一。
阈值往下调,漏诊少了,警报量和工作量同时上去;往上调,警报清净了,漏掉的人变多。这中间没有技术最优解,只有资源约束下的取舍。
这件事在中国的分母格外硬。2024 年,全国医院医师日均担负诊疗 6.7 人次,公立医院为 7.2 人次,每千人口执业(助理)医师 3.61 人。全年总诊疗 101.5 亿人次、入院 3.12 亿人次(前者含基层医疗卫生机构,与医院口径不同)。医生的注意力几乎没有弹性,多出来的每一条警报都要从别处挪。
还有一个容易被忽略的陷阱:预测目标选错,会把偏倚制度化。《科学》上的一项研究发现,一款被广泛用于人群健康管理的商业算法存在系统性种族偏倚,根源是它预测的是医疗费用而不是疾病,而由于就医机会不平等,花在黑人患者身上的费用本就更少;把预测目标纠正之后,能获得额外健康管理服务的黑人患者比例从 17.7% 升到 46.5%。这项研究的场景与中国不同,结论不能直接搬用,但机制值得记住——当你用一个容易拿到的代理指标(比如费用)替代真正想预测的东西(比如疾病严重程度),模型会忠实地学会那个代理指标背后的不平等。
二、何时干预:提前量要落在有人接得住的窗口里

预警能提前多久,是可以测出来的。
中国这方面有一份分量足够的研究。北京大学第一医院等 5 家医院合作,在 161,876 次住院上构建并验证了住院期间急性肾损伤的实时预测:预测未来 48 小时内是否发生 AKI,内部验证中位提前 72 小时,范围 24 到 198 小时;外部验证提前 54 到 90 小时,重度 AKI 为 78 到 108 小时。
但提前量本身不构成价值。72 小时的提前量,只有落在一个有人能接住的窗口里才有意义。这个窗口在中国其实已经有制度化的样子:《2026 年国家医疗质量安全改进目标》把感染性休克患者 1 小时、3 小时、6 小时集束化治疗完成率列为目标之一,并在工作措施里要求医护人员能够及时识别相关患者并给予规范治疗;同一份文件还要求借助信息化手段加强静脉血栓栓塞症预防提醒。识别能力与时间窗达标,是被并列写进国家年度目标的。
需要说清楚的是,这十项目标里并没有“住院患者早期预警”这一条,上面两项是目前最接近的抓手。时间窗的制度接口存在,但把模型的提前量对齐到这些节点上的流程设计,还得医院自己做。
三、如何干预:只把分数显示出来,已经被随机试验证否

这是最容易被跳过、也最致命的一步。
很多系统的做法是:算出风险,显示在界面上,剩下交给临床判断。这个假设已经被检验过了。一项整群随机对照试验在某学术医院 85 张床位的心内科与心外科病房进行,按房间号分成 11 个整群,纳入 10,422 次住院,把 AI 恶化风险轨迹以被动展示的方式呈现给医护人员,结果主要终点在全队列和高危亚组都没有统计学显著差异。这个结论的适用范围必须说清楚:它说明的是在这家医院的这个病房里,仅仅把分数摆出来不足以改变结局,而不是“AI 预警无效”。
那什么起作用?两项配套研究给出了比较具体的答案。TREWS 脓毒症预警系统在 5 家医院前瞻部署,监测 590,736 名患者。它的转化链条是这样的:系统在 9,805 例回顾性确认的脓毒症中灵敏度为 82%;发出的警报里,89% 被医生或高级执业医师实际打开评估;打开之后,38% 被确认为真脓毒症。在同一批被识别的患者内部比较,警报在 3 小时内被确认的人,首剂抗生素医嘱的中位时间比警报被驳回或未及时确认的人缩短 1.85 小时,住院死亡率相对下降 18.7%。
这个 18.7% 很容易被误读,必须讲明白:它不是“上线这套系统之后死亡率下降了 18.7%”。它比较的是同一批已经被系统识别出来的患者中,警报被及时确认的那部分和没被及时确认的那部分,属于院内自身对照,不是随机对照,而且存在确认偏倚——医生更可能确认那些看起来确实像脓毒症的警报。它能说明的是:采纳率是决定性的中间环节。研究还发现,急诊科医生、以及此前与该警报有过交互经验的医生,更可能打开并确认警报。这更像是组织与习惯问题,而不是模型问题。
规模最大的一次部署指向同一处。凯撒北加州 19 家医院在 2016 至 2019 年间错峰上线住院恶化预警,覆盖 548,838 次非 ICU 住院,预警后 30 天死亡率校正相对风险 0.84。作者和随刊评论都认为,起关键作用的是配套的集中化响应团队——一支远程 eICU 护士团队负责接住警报并推动处置,而不是模型本身。
警报量也可以被管住。加州大学圣地亚哥分校两家急诊科部署 COMPOSER 脓毒症模型的前后对照研究显示,干预期平均每月只产生约 235 条警报,约合每名护士每月 1.65 条;同期院内脓毒症死亡率由模型预期的 11.39% 降至实测 9.49%,集束化治疗依从率由预期 48.38% 升至实测 53.42%,提升 5.0 个百分点。这是准实验设计,不是随机对照,但它说明一件事:低警报量与有效性并不矛盾。

TREWS 在 5 家医院前瞻部署的转化链路。末行为院内自身对照,非随机对照。
四、干预是有代价的

目前关于院内恶化预警最严格的随机证据来自 CONCERN 试验:2 家美国医疗系统、74 个临床单元(37 个干预、37 个常规)、60,893 次住院。结果是双面的。住院死亡的瞬时风险下降 35.6%(校正风险比 0.64),脓毒症下降 7.5%,住院时长按原文报告下降 11.2%(校正发生率比 0.96);与此同时,非计划 ICU 转入上升了 24.9%(校正风险比 1.25)。
作者对最后这一项的解释是:更早识别导致了更主动的升级处置。这不是伤害,而是资源占用的转移——原本可能在病房里恶化的人,被提前送进了 ICU。
对医院管理者来说,这条比前面几条都更实用:上线预警系统之前,先算清楚下游承接能力。中国这方面的基数并不宽裕,全国平均每 10 万人口重症床位数从 2015 年的 2.83 张增至 2021 年的 4.77 张(有研究基于统计年鉴预测 2030 年达到 132,643 张,属模型外推)。而全国性的快速反应团队覆盖率,目前没有公开统计可查。谁来接住警报,在很多医院还是一个没有答案的问题。

CONCERN 整群随机对照试验:收益与下游资源占用同时出现。
五、中国现场的三道约束

第一道是数据底座。 2023 年度参加绩效监测的 2,168 家三级公立医院(不含中医)中,电子病历系统应用水平达到 4 级及以上的占 87.99%,较上一年提升 4.96 个百分点;但实现全流程医疗数据闭环管理、具备高级医疗决策支持能力(6 级)的只有 2.36%,全国 51 家。实时风险预测依赖的正是后者那种数据闭环。这是 2023 年度的口径,距今已有一段时间。另有一项 2018 年在 4 家北京三级医院开展的定性访谈研究归纳出输入端的典型障碍:工作量重、人员轮换、研究所需细节缺失、术语不统一、大量非结构化数据、患者识别与匹配困难。这是 19 人样本的定性研究,不能当作全国现状,但清单本身仍然成立。
第二道是噪声。 上海一家三甲医院 2022 年全年记录了 14,612 条用药相关警报,其中 86.6% 被医生覆盖(override,即查看后没有采纳)。这个数字很容易被读成“医生不看警报”,但同一项研究里另一个数字纠正了这个印象:在抽样评估的 1,501 条警报中,80.2% 属于被恰当地覆盖;而警报生成本身的适当率只有 57.9%。问题出在系统喊得太多太不准,不在医生。这是用药场景的单中心数据,与恶化预警不是一回事,迁移时要小心;但中国目前没有公开的院内预警警报负荷统计,这已经是最接近的一份实测。
第三道是泛化。 前面那项 5 家医院的 AKI 研究给出了一个很实在的数字:模型直接迁移到另一家医院,AUC 为 0.74 到 0.85;在本地重新拟合之后,才回到 0.81 到 0.90。跨院复用不是把模型拷过去就行。另一个例子是珠海一家医院的脓毒症模型,内部验证 AUC 0.818,用同一家医院不同时间段做外部验证为 0.771——两者置信区间重叠,只能说点估计有落差,而且这属于时间外部验证,不是跨机构验证。重庆 6 家中心 4,647 例的心衰模型 AUC 达到 0.850,作者自己在局限性中写明未做外部验证与前瞻验证。
三道约束叠加起来,构成了中国本土的真实起点:模型不缺,缺的是能证明它在自家医院有用的那一步。

中国现场的两组实测数字。左右两栏来源与场景不同,不可跨栏比较。
六、怎么知道有没有用

这是全篇最该被制度化、却最常被跳过的一步。国际上已经有一条相对成型的阶梯。
第一级是静默试验:模型在真实临床环境里前瞻运行,但不影响诊疗和运营,用来看它在真实数据流上的表现。一项覆盖 2015 至 2025 年、从 891 篇文章中纳入 75 项研究的范围综述指出,医疗场景的静默评估目前还没有正式指南,多数论文只报告 AUC 这类技术性能,很少把模型输出与真实临床金标准核验;而所有研究的共同结论是,从回顾性验证走到真实环境的实时评估,性能都会下降(该综述为定性归纳,未给出统一的下降幅度)。
第二级是早期真实临床评价,对应 DECIDE-AI 规范——包含 17 个 AI 专属报告条目(含 28 个子条目)与 10 个通用条目,专门覆盖“决策会直接影响患者诊疗”的首次真实场景评价。
第三级是随机对照试验,对应 CONSORT-AI,在 CONSORT 2010 基础上新增 14 个条目,要求讲清楚 AI 干预本身、使用所需技能、嵌入的场景、输入输出的处理方式、人机交互过程,并提供错误案例分析。
这条阶梯不能跳,因为效应量会在阶梯上缩水。一项纳入 36 项研究的系统综述与荟萃分析显示,自动化脓毒症预警系统总体与死亡率下降相关,合并相对风险 0.71;但只看随机对照试验时,效应缩小到 0.85 且不再具有统计学显著性。另一项纳入 65 项随机对照试验的系统综述评估了预测工具类 AI 的真实临床影响:38.5% 的试验没有观察到统计学显著获益;分工具看,机器学习的阳性率高于传统统计模型,但在 17 项被评为低偏倚风险的试验中,深度学习的优势被削弱,机器学习的优势完全消失。只有 26.2% 的试验被评为总体低偏倚风险。
中国最关键的一次检验也在这条阶梯上,结果值得认真对待。南京一家三级教学医院做了一项单中心双盲随机对照试验,纳入 2,208 例急性肾损伤患者。结论是两句话,必须一起读:自动电子警报改变了临床诊疗行为,但在 7 天死亡、住院死亡、28 天死亡、7 天内透析、AKI 进展这五项结局上均未观察到显著改善(P 值在 0.10 到 0.43 之间)。它没有证明警报有害,也没有证明警报无用;它证明的是——改变行为和改变结局之间,还隔着一段需要单独设计的距离。
上线之后还有两件事要制度化。一是报告与偏倚评估:临床预测模型的报告规范已在 2024 年完成 AI 化升级,TRIPOD+AI 于《英国医学杂志》发表,包含 27 个主条目、52 个子条目,并明确取代 2015 年版;配套的偏倚评估工具 PROBAST+AI 覆盖开发与评价两条路径。值得注意的是,在同一篇论文内完成外部验证的模型比例,十年间只从 10%(14/135)升到 12%(55/444),其中呈现校准曲线的不足三成——而校准,也就是“报 0.37 的时候是不是真有 37% 的人发生了事件”,恰恰是预测能不能拿来做决策的关键一环。二是变更管理:美国 FDA 的预定变更控制计划机制要求写明变更说明、变更方案与影响评估三件事,纳入已批准计划内的变更可以不重新提交上市申请(该终版指南 2024 年 12 月首发、2025 年 8 月修订)。中国这边,国家药监局 2021 年第 47 号通告的判定链条是:先看算法在医疗应用中的成熟度,成熟度低(未上市或安全有效性尚未充分证实)的产品,再按是否用于辅助决策分别按第三类、第二类管理;成熟度高的按现行分类目录执行。
七、给管理者的一份清单

把上面的证据翻译成可执行的顺序,大致是这样:
政策与支付的背景值得放进同一张表里看。国家卫生健康委办公厅等五部门 2025 年印发的《关于促进和规范“人工智能+医疗卫生”应用发展的实施意见》提出了时间表与覆盖面要求:到 2027 年建立高质量数据集与可信数据空间,到 2030 年二级以上医院普遍开展临床诊疗智能辅助决策(原文为定性覆盖面表述,未给出百分比)。更早的 2024 年《卫生健康行业人工智能应用场景参考指引》84 个场景中,已经列有“临床专病智能辅助决策”(场景 3)与“智能医疗质量管理”(场景 29)。支付端,截至 2025 年 4 月,国家医保局公布 DRG/DIP 已实现统筹地区与符合条件医疗机构全覆盖,病种覆盖率 95%、医保基金覆盖率 80%,并设有特例单议出口(DRG 不超过出院总病例的 5%,DIP 不超过千分之五)。这意味着“更早识别带来的下游资源占用”最终会落到成本账上,必须提前算进去。
结尾

回到护士站屏幕上那个 0.37。
它是不是一个好数字,取决于四件与建模无关的事:它筛出的人值不值得占用一次评估、它给出的提前量落不落在有人能行动的窗口里、它触发的动作有没有人负责、以及事后有没有人回头检验这件事到底有没有用。
现有最高等级的证据一致指向同一个判断:改变结局的从来不是模型的判别力本身,而是它周围那套流程。把这套流程建起来,比再提高几个百分点的 AUC 更难,也更值得做。

本文为行业观点,不构成诊疗建议。全部数据经逐条核对原始来源。
参考来源:
随机与前瞻证据
Real-time surveillance system for patient deterioration: a pragmatic cluster-randomized controlled trial(CONCERN). Nature Medicine, 2025-04-02 在线. https://www.nature.com/articles/s41591-025-03609-7 Prospective, multi-site study of patient outcomes after implementation of the TREWS machine learning-based early warning system for sepsis. Nature Medicine, 2022-07-21. https://www.nature.com/articles/s41591-022-01894-0 Factors driving provider adoption of the TREWS machine learning-based early warning system and its effects on sepsis treatment timing. Nature Medicine, 2022-07-21. https://www.nature.com/articles/s41591-022-01895-z Escobar GJ, et al. Automated Identification of Adults at Risk for In-Hospital Clinical Deterioration. New England Journal of Medicine, 2020;383(20):1951-1960. https://doi.org/10.1056/NEJMsa2001090 A randomized controlled trial of artificial intelligence-based analytics for clinical deterioration(CoMET). Scientific Reports, 2026-02-05. https://www.nature.com/articles/s41598-026-39051-z Impact of a deep learning sepsis prediction model on quality of care and survival(COMPOSER). npj Digital Medicine, 2024-01-23. https://www.nature.com/articles/s41746-023-00986-6 Automated Electronic Alert for the Care and Outcomes of Adults With Acute Kidney Injury: A Randomized Clinical Trial(南京单中心双盲 RCT,n=2,208). JAMA Network Open, 2024-01-19. https://jamanetwork.com/journals/jamanetworkopen/fullarticle/2814092
Wong A, et al. External Validation of a Widely Implemented Proprietary Sepsis Prediction Model in Hospitalized Patients. JAMA Internal Medicine, 2021;181(8):1065-1070. https://jamanetwork.com/journals/jamainternalmedicine/fullarticle/2781307 自动化脓毒症预警与死亡率:系统综述与荟萃分析(36 项研究). npj Digital Medicine, 2022-07-19. https://www.nature.com/articles/s41746-022-00650-5 预测工具类 AI 随机对照试验的系统综述(65 项 RCT). npj Digital Medicine, 2021-10-28. https://www.nature.com/articles/s41746-021-00524-2 临床预测模型外部验证比例(同一篇论文内口径). JAMIA, 2022;29(5):983. https://academic.oup.com/jamia/article/29/5/983/6511611 医疗 AI 静默试验范围综述(891 篇筛出 75 项). Nature Health, 2026-02-16. https://www.nature.com/articles/s44360-025-00048-z
Real-time prediction of acute kidney injury in hospitalized patients(5 家中国医院、161,876 次住院). Nature Communications, 2025-01-02. https://www.nature.com/articles/s41467-024-55629-5 用药相关警报覆盖率与适当性研究(上海,2022 年 14,612 条警报). Drug Discoveries & Therapeutics, 2024;18(2):89-97. https://www.jstage.jst.go.jp/article/ddt/18/2/18_2024.01012/_article/-char/en 脓毒症预测模型开发与时间外部验证(珠海). Frontiers in Medicine, 2025-02-05. https://www.frontiersin.org/journals/medicine/articles/10.3389/fmed.2025.1521660/full 心力衰竭风险模型(重庆 6 中心,4,647 例;作者自述未做外部验证). Cardiovascular Diabetology, 2024;23:407. https://link.springer.com/article/10.1186/s12933-024-02503-9 电子病历数据用于研究的障碍:4 家北京三级医院定性访谈(2018 年 3—7 月,19 名受访者). BMJ Open, 2019;9(7):e029314. https://bmjopen.bmj.com/content/9/7/e029314 我国重症医学资源现状与预测. 《中国卫生资源》, 2023;26(3):257-263. https://html.rhhz.net/ZGWSZY/html/2023-3-257.htm
国家卫生健康委办公厅.《2026 年国家医疗质量安全改进目标》(国卫办医政函〔2026〕63 号). https://www.nhc.gov.cn/yzygj/c100068/202603/9f642951b99c447f8cff9da8abb74dc3/ 国家卫生健康委等.《2023 年度全国三级公立医院绩效监测分析情况的通报》(国卫医政函〔2025〕55 号), 2025-03-10. https://www.gov.cn/zhengce/zhengceku/202503/content_7016208.htm 国家卫生健康委办公厅等五部门.《关于促进和规范“人工智能+医疗卫生”应用发展的实施意见》(国卫办规划发〔2025〕30 号). https://www.gov.cn/zhengce/zhengceku/202511/content_7047018.htm 国家卫生健康委办公厅等.《卫生健康行业人工智能应用场景参考指引》(84 个场景), 2024-11. https://www.nhc.gov.cn/guihuaxxs/c100133/202411/3dee425b8dc34f739d63483c4e5c334c/ 国家药品监督管理局.《人工智能医用软件产品分类界定指导原则》(2021 年第 47 号通告), 2021-07-08. https://www.nmpa.gov.cn/ylqx/ylqxggtg/20210708111147171.html 国家医疗保障局. DRG/DIP 付费 2.0 版分组方案政策解读, 2024-07-23. https://www.nhsa.gov.cn/art/2024/7/23/art_105_13316.html 国家卫生健康委.《2024 年我国卫生健康事业发展统计公报》, 2025-12. https://www.nhc.gov.cn/guihuaxxs/c100133/202512
Collins GS, et al. TRIPOD+AI statement. BMJ, 2024-04-16. https://www.bmj.com/content/385/bmj-2023-078378 Vasey B, et al. DECIDE-AI. Nature Medicine, 2022;28:924-933. https://www.nature.com/articles/s41591-022-01772-9 Liu X, et al. CONSORT-AI extension. Nature Medicine, 2020;26:1364-1374. https://www.nature.com/articles/s41591-020-1034-x Obermeyer Z, et al. Dissecting racial bias in an algorithm used to manage the health of populations. Science, 2019;366(6464):447-453. https://www.science.org/doi/10.1126/science.aax2342 FDA. Predetermined Change Control Plan for AI-Enabled Device Software Functions(2024-12-04 首发 / 2025-08-18 修订). https://www.fda.gov/regulatory-information/search-fda-guidance-documents/marketing-submission-recommendations-predetermined-change-control-plan-artificial-intelligence

关于每因智能(MayIn.ai):
每因智能致力于成为全球领先的疾病演化世界模型平台公司。公司以疾病演化世界模型为核心技术底座,依托时序医疗数据、知识增强推理与动态决策智能体等AI技术,面向医院、药企、保险机构及患者群体,提供疾病风险预测、专病管理以及保险风控等全链条服务,推动医疗体系从“疾病诊断”走向“风险预测与闭环管理”。


