每因智能·行业观察
AI医疗从“回答问题”走向“疾病演化预测”
数据截止 2026-07-15

1
在医院里,最难的问题常常不是“这个病人现在怎么了”,而是“他接下来会怎样,我现在该做什么”。
在医院里,最难的问题常常不是“这个病人现在怎么了”,而是“他接下来会怎样,我现在该做什么”。一个急诊病人此刻指标平稳,不代表接下来几个小时不会恶化;一个慢病患者这次复查正常,也不代表未来一年都不需要提前干预。医生每天面对的,是在信息不全、时间有限的情况下,对还没有发生的事情做判断。
这正是衡量医疗 AI 是否真正有用的地方。
2
医疗AI已经解决了什么
过去两三年,医疗领域的人工智能大量集中在几类工作:回答医学问题、生成和整理病历文书、检索文献与指南、充当医生和患者的对话助手。这些应用有实际价值。它们能把医生从重复的文字工作里解放出来,能让病人更容易读懂一份检查报告,也能帮基层医生快速查到规范。多篇综述都记录了大语言模型在这些场景中的进展,同时也指出了它们的技术与伦理边界。
把这些工具做好并不容易,也确实解决了真实的问题。但如果医疗 AI 停在这里,它触及的还是相对表层的部分。
3
为什么“回答正确”仍然不够
一个模型能在医学考试里拿高分,能对着一段病历说得头头是道,并不等于它能在真实诊疗中做出可靠判断。2024 年发表在《自然·医学》的一项研究,说明了这中间的距离。研究者用两千多个真实住院病例,考察大语言模型能否像医生那样一步步收集信息、判断并处理四种常见的腹部急症。结果是,这些模型的诊断准确率明显低于医生,差距大约在十六到二十五个百分点;当模型需要自己决定该问什么、该查什么时,表现进一步下滑;它们甚至在判断一个化验值是偏高还是偏低这种基础问题上频繁出错。研究者的结论很直接:这些模型还不能用于自主的临床决策。


真实病例上,大语言模型的诊断准确率明显低于医生。来源:Nature Medicine, 2024
问题不在于模型“知道得不够多”,而在于医疗决策本身的性质。同一个诊断,放在不同的人、不同的时间、不同的合并症背景下,处理方式可能完全不同。病情随时间变化,一个决定的后果有时要很久才显现。回答一个封闭的问题,和在变化中做出一连串带后果的判断,是两件事。
4
从静态识别到理解疾病如何演化
要跨过这段距离,AI 需要理解的不只是“此刻的一张快照”,而是疾病如何随时间演化。
很多传统医疗模型处理的是静态问题:给定此刻的一组指标,判断有没有某种病、属于哪一类。这类识别很有用,但它默认时间是凝固的。真实的病人不是这样,指标在动,状态在变,早期一个细微的趋势,有时比某一次的绝对数值更重要。
一个正在被研究的方向,是把一个人的医疗记录看成一串带时间戳的事件——什么时候做了什么检查、用了什么药、出现了什么变化——让模型从这串序列里学习疾病演化的规律,而不是只看孤立的一点。有研究者把这种思路称为对电子病历的“下一事件预测”,希望模型能像语言模型预测下一个词那样,学会预测一个病人接下来可能发生什么。需要说明的是,这类工作大多还在研究阶段,其中不少尚未经过同行评议,离临床可用还有距离。但它指向的问题是真实的:医疗需要能理解时间和轨迹的模型。


从识别,到理解疾病如何演化,再到决策与验证(概念示意)
5
从预测走向决策
就算模型能预测出一个风险概率,事情也没有结束。预测一个数字,和据此做出正确的决策,仍然隔着一段路。
一个被反复引用的例子,是被很多医院部署过的 Epic 脓毒症预警模型。2021 年,密歇根大学的研究者在近四万次住院数据上对它做外部验证,发现它的判别能力(AUC)只有 0.63,漏掉了大约三分之二真正发生脓毒症的病人,同时对将近五分之一的住院病人拉响了警报。一个模型即便挂在系统里、每天都在预测,如果漏报太多、误报太多,临床上未必用得起来,反而可能带来“警报疲劳”——医生被太多无效提醒淹没,慢慢不再理会。


预测得出概率,不等于决策有用:一个被广泛部署的脓毒症模型的外部验证。来源:JAMA Internal Medicine, 2021
所以真正的问题不止是“预测得准不准”,而是一连串更具体的问题:谁需要干预,什么时候干预,用什么方式干预,以及干预之后如何验证效果。一个有用的系统,要能把风险落到具体的人和具体的动作上,能嵌进医生本就繁忙的流程,还要能回过头来检验——我们当初的判断对吗,这次干预有没有让结果变好。预测是起点,决策和验证才是医疗真正关心的。
6
这对不同的人意味着什么
把视角从单个病人放大,这种从“识别”到“演化与决策”的转变,会影响不同的角色。
对医院来说,它意味着从事后记录转向事前识别:哪些住院病人可能在接下来恶化,有限的重症资源应该向谁倾斜。对商业健康保险和健康管理机构来说,风险管理正在从相对静态的评分,转向更动态、更个体化的风险预测,用来更早发现需要关注的人群,前提是处理好公平与合规。对城市公共卫生而言,它关心的是人群尺度上的健康风险和资源配置,而不只是一块展示数据的大屏。对临床科研来说,能理解疾病轨迹的模型,本身就是研究疾病如何发展、干预如何起效的新工具。
这些方向的共同点是:价值不在于生成了多少内容,而在于能不能更早、更准地看见风险,并帮助人做出更好的决定。
7
每因智能正在关注什么
每因智能关注的,正是这条从“理解信息”走向“理解时间、风险与决策”的路径。围绕这个方向,我们关注几个具体问题:疾病如何随时间演化,如何从预测走向可执行的决策,如何面向具体的疾病构建更专注的智能体,以及如何在城市尺度上管理健康风险。
8
结尾
医疗 AI 的价值,最终不在于它生成了多少文字,而在于它是否帮助人们更早识别风险、做出更合适的决策,并持续验证这些决策的结果。能回答问题只是开始。医疗真正需要的,是能理解时间、看见风险、并对结果负责的系统。
参考文献:
Hager P, et al. Evaluation and mitigation of the limitations of large language models in clinical decision-making.NatureMedicine,2024.
https://www.nature.com/articles/s41591-024-03097-1
Wong A, et al. External Validation of a Widely Implemented Proprietary Sepsis Prediction Model in Hospitalized Patients. JAMA Internal Medicine, 2021;181(8).
https://pmc.ncbi.nlm.nih.gov/articles/PMC8218233/
Building the EHR Foundation Model via Next Event Prediction. arXiv:2509.25591, 2025(预印本,未同行评议).
https://arxiv.org/abs/2509.25591
Large Language Models in Medicine: Clinical Applications, Technical Challenges, and Ethical Considerations.PMC12086438,2025.
https://pmc.ncbi.nlm.nih.gov/articles/PMC12086438/
Rethinking Risk Stratification in Healthcare with AI(行业分析), 2025.
https://innovaccer.com/blogs/rethinking-risk-stratification-in-healthcare-with-ai-the-future-beyond-raf-scores


关于每因智能(MedIn.ai):
每因智能致力于成为全球领先的疾病演化世界模型平台公司。公司以疾病演化世界模型为核心技术底座,依托时序医疗数据、知识增强推理与动态决策智能体等AI技术,面向医院、药企、保险机构及患者群体,提供疾病风险预测、专病管理以及保险风控等全链条服务,推动医疗体系从“疾病诊断”走向“风险预测与闭环管理”。


