欢迎访问智慧医疗网 | 网站首页
 

速递|上海启用算力服务中心,AI医疗补上训练与评测底座

发布时间:2026-07-20 来源:AI医疗观察 浏览量: 字号:【加大】【减小】 手机上观看

打开手机扫描二维码
即可在手机端查看

医疗AI过去几年并不缺模型,也不缺演示效果,真正稀缺的是一套能够让医院放心使用、让技术团队低成本训练、让产品在进入临床前接受严格检验的公共底座。


7月18日,这块底座又向前推进了一步。上海市卫生健康行业算力服务中心正式揭牌启用,MedBench5.0医疗AI评测体系和疑难病例诊疗评测基准MedXIAOHE-1.0同步发布。与单一模型或应用上线相比,这次发布更像是在建设一套医疗AI的“公共试验场”:前端提供算力和数据资源,中间支持模型训练,后端负责能力测试、风险识别和应用验证。


服务中心由上海仪电集团参与建设运营。上海仪电已经由传统仪器仪表企业逐渐转向人工智能、新一代信息技术服务和电子信息制造,此前也参与过智慧医院基础设施、重症医学数字化、医疗物联网和算力平台建设。此次进入医疗AI公共服务环节,意味着它承担的不只是服务器供给,还包括资源调度、数据处理和模型应用之间的连接工作。


从单点项目走向公共底座,医疗AI开始补齐最昂贵的一环


大模型进入医疗行业之后,一个反复出现的问题是:每一家机构都在重复搭建相似的基础设施。


医院掌握高价值数据,却受到隐私、安全和合规要求限制,无法像普通互联网数据一样自由流通;模型团队需要大量专业语料,却往往缺少稳定的数据处理和医学标注能力;应用企业即使完成产品,也需要分别适配不同医院的系统、算力环境和管理流程。结果是模型开发成本高、验证周期长,许多看起来成熟的技术始终停留在试点阶段。


此次启用的算力服务中心,试图把这些分散环节连接起来,形成从算力供给、数据采集与合成、模型训练到智能应用的完整链路。公开信息显示,当地已经搭建医疗AI数据湖基础设施,数据准备周期缩短60%以上,并计划在2026年底形成规模超过2PB的医疗健康成品语料库。


这组数字真正值得关注的地方,不只是数据量,而是数据能否被整理成模型可以安全使用的“成品”。原始病历、影像、检验结果和医生记录并不能直接用于训练,必须经历脱敏、清洗、标注、质量控制和权限管理。很多医疗AI项目最耗时间的部分,并不是训练模型,而是把数据变成可训练、可追溯、可审计的资源。


如果公共服务中心能够持续提供这类能力,医疗AI企业未来未必需要从头建设数据和算力体系,可以把更多资源投入临床场景设计、产品验证与医院交付。医院也不必为每一个模型重复配置基础环境,而是能够在相对统一的框架中引入、测试和管理不同应用。


不过,揭牌启用只能说明平台已经进入运行阶段,距离形成成熟的产业服务仍有几道关卡。超过2PB的语料库目前还是年底建设目标,数据准备周期缩短60%以上也尚未公开统计范围、比较基线和具体样本。中心最终能否降低使用成本,还要看算力如何计费、数据如何授权、企业能否平等接入,以及训练完成后的模型能否顺利进入医院验证。


因此,这次事件的意义并不是“算力问题已经解决”,而是医疗AI开始从各自建设、各自验证,向公共基础设施支撑的模式转变。这个方向一旦跑通,受益的不会只是一家模型公司,而可能是整条医疗AI产业链。


评测不再只看答对多少,医疗AI正在建立更接近临床的考试


与算力中心同时发布的MedBench5.0,是这次事件中另一个具有长期价值的部分。


传统医疗AI评测经常采用固定题库,通过模型最终回答的准确率判断能力。这种方法简单直观,却容易遗漏临床使用中更危险的问题:模型可能偶然给出正确答案,但推理过程并不稳定;面对缺失、矛盾或延迟出现的信息时,也可能坚持最初判断,甚至把一个错误逐步放大。


MedBench5.0把评测重点从“最后答对没有”进一步转向“模型是如何得到答案的”。公开论文显示,该体系覆盖63类任务,引入信息缺失、证据矛盾和证据延迟等压力条件,并观察模型在诊断更新、矛盾识别、证据引用和错误传播等环节的表现。


微信图片_2026-07-20_151021_892.png


这更接近真实医疗环境。临床信息很少一次性完整出现,医生通常需要根据新检查、新症状和病情变化不断修正判断。一个模型如果只会在标准题库中给出漂亮答案,却不能在证据变化时调整结论,其临床价值依然有限。


同步发布的MedXIAOHE-1.0则把难度进一步提高。该基准覆盖30个临床专科,设置千题规模的疑难病例,用于检验模型面对复杂病情、多种疾病并存和长链条推理时的能力。相比常见医学问答,疑难病例更容易暴露模型在长尾疾病、证据取舍和跨学科推理上的短板。


这里也需要避免一种过度乐观的理解。评测体系可以发现幻觉、记录幻觉如何传播,并帮助开发团队定位问题,但它本身不能自动消除幻觉。MedBench5.0公开论文采用的表述主要是压力测试、过程审计和幻觉轨迹分析。因此,“校正幻觉”更准确的理解,是为后续模型改进提供依据,而不是经过测试的模型便不会出错。


目前,当地医疗大模型应用检测验证中心已披露累计服务近12万名用户、完成超过31万次评测服务。这个规模说明评测需求已经出现,但“评测次数”不能直接等同于通过验证的模型数量,更不能等同于临床效果。下一步更关键的信息,是有多少模型完成完整测试,有多少问题在测试后得到修复,又有多少产品进入真实医院并持续运行。


从更长周期看,医疗AI的竞争标准正在发生变化。早期比拼的是谁能更快推出模型,接下来比拼的将是数据质量、临床验证、风险控制和持续交付能力。算力中心解决“能不能训练”,评测体系回答“能不能信任”,医院场景最终检验“能不能长期使用”。


上海此次同时推进算力、语料、训练、评测和中试,并不意味着商业化难题已经全部解开,却让医疗AI从产品展示走向体系化落地多了一条更清晰的路径。真正令人期待的,不是又多了一个中心或一套榜单,而是医疗AI终于开始建设进入真实医疗系统之前必须经过的基础设施和质量关卡。

免责声明:

智慧医疗网转载其他网站内容,出于传递更多信息而非盈利之目的,内容仅供参考。版权归原作者所有,若有侵权,请联系我们删除。

本平台所发布信息的内容和准确性由提供消息的原单位或组织独立承担完全责任!

凡来源注明智慧医疗网的内容为智慧医疗网原创,转载需获授权。

Copyright © 2022 上海科雷会展服务有限公司 旗下「智慧医疗网」版权所有    ICP备案号:沪ICP备17004559号-5