生成式AI进入医院之后,最容易回答的问题是“医生有没有使用”,最难回答的却是“使用之后究竟改变了什么”。
7月16日,波士顿儿童医院与临床决策支持平台OpenEvidence宣布开展一项多年合作。双方不只是把AI工具接入电子病历,还准备研究医生在诊疗现场使用AI后,临床提问、诊疗选择和医疗服务方式是否发生变化。
OpenEvidence是一家面向专业医疗人员提供医学搜索与临床决策支持的公司。医生可以用自然语言提出问题,平台根据同行评议论文、临床指南和权威医学内容生成带有来源的回答。与传统医学数据库相比,它试图把“查文献”变成“直接提出临床问题并获得证据梳理”。
这次合作已经有明确的落地抓手,但还不能被写成一次得到临床验证的成功。电子病历入口已经接通,研究框架也已公布;至于它能否改善诊疗质量、降低差异或者节约医疗资源,仍要等待后续数据。
AI进入电子病历,合作开始触及真实诊疗流程 根据双方公布的信息,这项多年合作主要包含两部分。 第一部分,是让波士顿儿童医院的医生能够直接从电子病历系统访问OpenEvidence。医生不必在多个独立平台之间来回切换,就能在诊疗过程中查询治疗方案、药物选择、疾病管理和最新医学证据。 这项变化看起来只是少了几次点击,实际解决的却是医疗AI长期面临的一个核心问题:工具能不能进入医生每天使用的工作界面。 一款AI产品即便在测试中表现不错,如果需要医生额外登录、重复录入患者信息,或者离开电子病历才能使用,最终也可能因为流程负担而被搁置。把AI放进电子病历入口,意味着产品开始从“医生想起来时使用的工具”,转向临床工作流中的常规能力。 第二部分更加值得关注。双方将研究医生使用OpenEvidence与实际诊疗模式之间的关系,包括医生在什么场景下向AI提问、关注哪些临床问题,以及这种使用行为是否与更广泛的医疗服务变化相关。 研究不会调用患者层面的数据,而是分析经过汇总的医生层面信息。换句话说,研究重点不是追踪某名患者接受了什么治疗,而是从群体尺度观察医生怎样使用AI,以及使用习惯是否对应某些诊疗模式。 这一设计让合作拥有了比普通产品部署更清晰的研究方向。过去评价医疗AI,往往集中在准确率、考试成绩或者模型能否回答标准化问题。但医生在真实诊疗现场提出的问题远比考试题复杂:信息可能不完整,多个疾病相互影响,指南之间也可能存在差异。 因此,回答是否正确只是第一层。医生是否采纳、什么情况下采纳、使用后是否减少无效检查,以及不同医生之间的诊疗差异有没有收窄,才是AI医疗真正进入临床后必须面对的问题。 不过,目前双方没有公布具体研究终点、对照组设置、评价周期以及结果发表计划,也没有给出诊疗质量或者成本改善数据。这意味着此次合作已经开始落地,但其临床价值仍处于验证阶段。 从“提供答案”走向“解释影响”,医疗AI进入更难的阶段 这次合作真正重要的地方,不是又有一家医院接入了AI,而是评价医疗AI的方式可能正在发生变化。 今年6月,《Nature Medicine》发表了一项独立研究,将OpenEvidence等专业医疗AI与通用大模型进行比较。结果显示,在医学知识题、医生一致性评价和部分真实临床问题上,通用模型整体表现更好。与此同时,另一项采用真实临床提问并由相应专科医生评价的研究,却得出了OpenEvidence在准确性、临床实用性、来源质量和可核验性方面领先的结果。 看似矛盾的结果,恰恰说明医疗AI已经不能只靠一套题目决定胜负。测试问题来自哪里、由谁评分、是否展示文献来源,以及评价者是否具备对应专科背景,都可能改变最终结果。 波士顿儿童医院与OpenEvidence此次选择研究真实使用行为,相当于把评价坐标从“模型回答得怎么样”向前推进了一步:医生在什么时候需要它,它是否进入了决策过程,又是否改变了后续行动。 对医疗AI公司而言,这种转向可能重塑未来的竞争门槛。 模型能力可以快速追赶,界面也容易模仿,但进入医院工作流、获得持续使用并建立可验证的临床证据,需要更长时间。真正形成壁垒的可能不再只是某一次测试中的准确率,而是产品能否嵌入诊疗现场,并持续证明自己带来了稳定、可解释且安全的改变。 这也意味着医院与技术公司的合作关系正在变深。医院不再只是购买一个软件账号,而可能参与研究设计、使用监测、风险治理和效果评价。技术公司则不能只交付模型,还要回答哪些医生在使用、为什么使用、什么时候不应使用,以及错误建议如何被识别和纠正。 此次合作使用汇总后的医生层面数据,并明确不调用患者层面数据,为隐私保护划出了一条边界。但数据经过汇总并不等于所有治理问题已经解决。医生的查询记录可能反映科室压力、疾病趋势和诊疗偏好,后续仍需要明确数据保存期限、访问权限、用途边界以及研究结果如何公开。 更值得期待的是,这类研究有机会让医疗AI第一次形成较完整的价值链条:医生提出真实问题,AI提供可追溯的医学证据,医院观察使用行为,再用研究结果改进产品和临床流程。 如果后续能够证明AI不仅缩短了信息检索时间,还能减少低价值诊疗、缩小医生之间的决策差异,或者帮助复杂病例更快获得可靠依据,那么医疗AI的价值就不再停留在“回答问题”,而是开始进入医院能够衡量和采购的结果层面。 反过来,如果研究发现AI使用频率很高,却没有带来诊疗质量改善,甚至造成新的依赖和行为偏差,这同样是一项有价值的结果。临床真正需要的从来不是使用量最大的AI,而是能够被验证、被监督,也能够在必要时被限制的AI。 所以,这次合作可以确认已经落地,但它落地的是电子病历入口和多年研究机制,而不是最终临床成效。它最令人期待的地方,正是双方愿意把一个更困难的问题摆到台面上:当AI已经成为医生日常使用的工具,我们该如何判断它究竟让医疗变得更好了没有?

免责声明:
智慧医疗网转载其他网站内容,出于传递更多信息而非盈利之目的,内容仅供参考。版权归原作者所有,若有侵权,请联系我们删除。
本平台所发布信息的内容和准确性由提供消息的原单位或组织独立承担完全责任!
凡来源注明智慧医疗网的内容为智慧医疗网原创,转载需获授权。