小七:是否在窗外的声音更加美妙呢?困在笼子里的小鸟说。
读者朋友们,大家好!本期,笔者将分享由重庆医科大学附属第一医院护理、公卫、AI交叉团队撰写,核心是系统解读2025 年8月国际发布的CHART声明—— 全球首个生成式 AI聊天机器人健康建议研究统一报告标准,这一份报告指南解决当前该领域研究报告杂乱、不可复现、证据可信度低的痛点,为国内AI医疗健康研究规范化提供参考。
目前,AI 领域术语不统一,学术交流存在壁垒;无统一报告框架,审稿、评价无标准化依据;很少单独评估 AI 输出有害、误导性医疗建议,存在临床安全隐患。这一份指南通过系统评价 + 多轮国际德尔菲专家共识制定,2025 年8月发表于《BMC Medicine》,专门针对评估 AI 聊天机器人健康建议性能的观察性研究。CHART 指南三大核心体系,分别如下所示:
(一)标准化术语表:统一19个核心概念,消除行业沟通壁垒
针对AI医疗术语混用问题,对提示词、提示词工程、微调模型、RAG调优模型、金标准、多模态LLM等19项专业名词给出专属定义,重点区分易混淆概念:
1、CHA研究专属“金标准”:特指临床指南、专家共识,非机器学习标注数据;
2、提示词工程:包含角色设定、思维链、迭代测试全套设计策略;
3、调优模型:将 RAG 检索增强生成归入此类,区别于参数微调模型;
4、明确区分基础模型、微调模型、调优模型、多模态大模型四类模型。

(二)全流程强制透明化完整报告清单(12大模块,核心规范)
清单覆盖从标题到开放科学全研究链条,强制披露 AI 特有关键变量,核心模块与要求如下:
1、标题与摘要(1a~1b)
标题明确标注研究对象为 GAI 健康聊天机器人;摘要采用结构化格式,必须写明模型版本、提示词、评价指标,不能仅笼统描述性能。
2、引言(2a~2b)
阐明研究背景、核心科学问题、目标人群、主要评价结局指标。
3、模型标识(3a~3b)
完整披露模型名称、精确版本、发布、更新日期、开源、闭源属性;因模型迭代会大幅改变输出效果,该信息是研究复现基础。
4、模型细节(4a~4c)
区分模型类型(基础、全新基础、调优、微调),说明训练依据、部署前开发、上线后迭代更新情况;不同模型训练数据、参数规模会带来偏倚风险,必须完整说明。
5、提示词工程(5a~5b)
完整公开全部提示词原文、开发迭代流程、参与设计人员(临床 + AI多学科团队);提示词是影响AI输出最关键人为变量,不公开则研究完全无法复现。
6、查询策略(6a~6d)
记录API /网页等访问渠道、精确查询日期、查询地理位置、独立会话设置、完整原始对话输出;模型响应会随时间、地区、对话上下文变化,原始输出方便同行核查事实错误、偏见、危险建议。
7、性能评估(7a~7b)
清晰定义评判用金标准(临床指南、专家共识);完整说明评估团队专业构成、是否对评估者设盲(消除主观偏好)、有无患者、公众参与评价;健康建议无绝对标准答案,设盲是保障评价客观的关键手段。
8、样本量与数据分析(8、9a)
说明样本量科学计算方法(而非随意选取测试问题)、全部统计学方案、选用的准确率、召回率等性能指标;大量现有研究样本量无统计依据,结论偶然性强。
9、结果报告(10a~10c)
不仅报告模型与金标准一致性,还要区分错误类型(信息缺失、逻辑矛盾、危险医疗建议),单独统计有害、偏见、误导性输出;仅统计整体准确率会掩盖重大安全风险。
10、讨论(11a~11c)
解读结果、客观分析研究局限、阐述临床落地价值。
11、开放科学模块
强制披露利益冲突、项目资助、伦理审批文件、原始数据、对话样本共享方案。
(三)结构化摘要清单
从完整清单提炼15项核心要素,要求摘要压缩呈现模型版本、提示词来源、评价标准、关键结果等关键信息,解决传统摘要只报准确率、缺失方法细节的弊端,提升审稿人、读者快速判读研究质量的效率。

好,本期的内容分享就到这里,如需要科研辅导包含选题、数据分析、写作、润色、选刊指导等欢迎大家添加笔者微信进行详细咨询或对免费学习群感兴趣,也欢迎入群学习交流!欢迎添加微信【Nursing_outlook】,备注来意,做科研不迷路!
本期参考内容如下所示:
《CHART声明:聊天机器人健康建议研究报告指南》要点解读


