欢迎访问智慧医疗网 | 网站首页
 
当前位置:首页 > 咨询 > 分析

卫健委反复提到的“高质量数据集”到底是什么?中国真的没有可用的医疗数据集吗?

发布时间:2026-08-10 来源:创新RWD 浏览量: 字号:【加大】【减小】 手机上观看

打开手机扫描二维码
即可在手机端查看

如果这两年持续关注“人工智能+医疗卫生”政策,会发现一个高频词正在反复出现:高质量数据集。卫健委等部门在政策文件中反复提出,要建设卫生健康行业高质量数据集和可信数据空间。问题是:中国每年产生海量诊疗数据,三甲医院也沉淀了大量电子病历、影像、检验、用药和随访信息,为什么政策还要反复强调“建设高质量数据集”?难道中国没有真正可用的高质量医疗数据集吗?这个问题问到了中国医疗AI和医疗数据要素价值化的核心痛点。答案可能比很多人想象得更直接:

中国不缺医疗数据,但缺少真正“可计算、可验证、可复用、可合规使用”的高质量医疗数据集。

01
为什么欧美模型到了中国经常“水土不服”?

很多人对医疗AI和临床预测模型有一个误解:只要模型在欧美大样本中表现好,拿到中国人群身上也应该差不多。
事实恰恰相反。
你去体检,报告上那个10年心血管风险百分比——它背后跑的,大概率是基于Framingham心脏研究的算法。这项研究1948年起步,跟踪的是马萨诸塞州一个小镇上的白人群落。
阜外医院的研究早就验证了:把Framingham风险评分直接套到中国人群头上,会系统性高估你的心血管风险——翻译成人话就是,它可能告诉你要吃药了,但实际上你没那么危险,结果是过度用药、过度干预、不必要的焦虑。
再看乳腺癌多基因风险评分(PRS)——欧美开发的PRS平均基于78%欧洲裔数据,只有10%亚洲裔,直接迁移到亚洲人群准确性明显下降。中国至今没有一个专门针对黄种人的大规模乳腺癌风险预测模型。
甚至连1型糖尿病的遗传风险评分都出了问题:湘雅二医院的团队发现,欧洲构建的HLA风险位点在中国人群中可能不敏感甚至失效,因为中欧人群的遗传背景差得太远了。
角膜病也是。王雁教授团队的研究很直白:欧美设备和诊断技术"可能未能充分考虑中国人群特征"——中国人与欧美人在角膜厚度、曲率、前后表面高度等方面存在显著差异。他们最后不得不自己搞了一套China CCBI(中国角膜生物测量指数)才把精度拉回来。

一句话:中国14亿人,每年诊疗80亿人次,但我们临床决策背后的"参考数据底盘",很大一块是别人用别人的身体替我们建的。

这不是某个医生的锅,也不是"崇洋媚外"——它是一个基础设施级别的缺口。
这也是为什么中国需要自己的高质量医疗数据集。
不是为了“民族情绪”,而是为了临床准确性。
02
中国不缺数据,缺的是“可计算、可验证、可复用”的数据集
中国医疗系统每年产生海量诊疗数据。门诊、住院、检验、影像、用药、手术、随访、医保支付、公共卫生管理,都在持续沉淀数据。
但原始数据不等于高质量数据集。
真正的高质量医疗数据集,至少要满足七个条件:

  • 概念标准统一。同一个指标、同一种疾病、同一个药品,不能在不同医院有不同字段名、不同单位、不同编码体系。
  • 表型足够完整。不仅要有诊断名称,还要有症状、体征、检验、影像、治疗、用药、并发症、结局等完整链条。
  • 时间连续可追踪。预测模型最需要的是纵向数据,而不是一次就诊的静态快照。
  • 结局清晰可靠。没有死亡、复发、住院、并发症、疗效、安全性等结局变量,模型只能学到“过程”,学不到“结果”。
  • 专家标注可质控。医学数据不是普通文本,关键征象、影像表现、病理分型、疾病严重程度都需要专业标注和一致性控制。
  • 人群具有代表性。如果数据几乎全部来自头部三甲医院,就很容易训练出只适合大医院患者的模型,难以覆盖基层、老年、慢病、罕见病和多样化人群。
  • 合规可用、可审计、可追溯。医疗数据涉及敏感个人信息,不能靠“发个Excel”“删掉姓名”就流通。它必须经过分类分级、伦理审查、脱敏匿名化评估、用途限定、日志审计和安全交付。

满足这些条件的数据,才是真正意义上的“AI-ready医疗数据集”。
而中国当下最大的问题是:有数据存量,但缺少把原始数据炼成高质量数据集的工程体系。
03
为什么医院里的数据大多还是“死数据”?
医院的数据之所以很难变成高质量数据集,核心不是技术单点问题,而是制度、历史和经济三重结构性问题。
第一重,是制度枷锁
医疗健康信息属于敏感个人信息。只要涉及可识别个人,就不能简单开放、复制、传输、交易。医院作为数据持有方,天然会采取保守策略。对医院法务和信息部门来说,“不用数据”通常比“用错数据”风险更低。
第二重,是历史枷锁
过去二十多年,中国医院信息化建设的主要目标并不是科研和AI训练,而是挂号、收费、医保、病案、行政统计和等级评审。HIS、LIS、PACS、EMR、随访系统、科研系统往往各自建设,字段、口径、编码、接口、质量控制并不统一。
所以医院不是没有数据,而是数据没有按照“可研究、可训练、可复用”的目标被组织起来。
第三重,是经济枷锁
整理医疗数据是一项高成本工程。要做数据治理、标准映射、脱敏处理、质量控制、专家标注、伦理审查、可信空间接入、数据产品登记和持续更新。这些工作都要花钱、花时间、占用医生和信息科资源。
但长期以来,医院缺少清晰的收益回路:谁来付费?收益归谁?医生标注有没有激励?医院投入能不能形成资产?成果转化怎么定价?如果这些问题不解决,数据治理就很容易变成“公益口号”,而不是可持续机制。
04
政策真正想解决什么?
这也是近期政策最值得关注的地方。
五部门关于“人工智能+医疗卫生”的政策信号,并不是简单喊一句“医疗AI要发展”,而是开始把底层问题说清楚:没有高质量数据集,就没有真正可靠的医疗垂直大模型;没有可信数据空间,就没有可持续、可审计、可合规的数据使用机制。
这背后的路线不是“把医院数据拿出来卖”,而是另一套逻辑:
数据可以不出域,但模型和算法可以进来;医院可以不交付原始数据,但可以授权使用数据能力;企业可以不占有数据,但可以获得合规的计算结果、模型能力和研究证据;数据可以不是商品化的原始表格,而是场景化、权限化、可审计的数据产品或数据服务。
这就是“可信数据空间”“隐私计算”“授权运营”“高质量数据集”“中试基地”这些概念同时出现的原因。
它们本质上是在回答同一个问题:
在医疗数据不能自由流通的前提下,如何让数据价值被合规释放?
05
2027年能不能建成真正可用的医疗数据集?
要诚实地说:不能过度乐观。
政策提出“到2027年建立一批卫生健康行业高质量数据集和可信数据空间”,这里的关键词是“一批”,不是“全国全面建成”。
更现实的判断是:到2027年,可能会出现一批专病、专科、专场景的数据集试点,比如影像、肿瘤、心脑血管、罕见病、儿科、中医药、基层慢病管理等方向;也可能会形成若干可信数据空间和国家人工智能应用中试基地,用于支撑模型训练、应用验证和数据产品化探索。
但这还远远不等于中国已经拥有可系统替代欧美队列和欧美模型体系的国家级医疗数据基础设施。
真正高质量的数据集,尤其是能支持预测模型、药械研发、真实世界证据和精准医学的数据集,需要长期随访、稳定队列、标准化表型、跨机构联通、专业标注和持续资金投入。这不是一年两年能完成的事情,更像是一个2030年以后才能逐渐成型的国家工程。
06
下一阶段的机会不在“拿数据”,而在“炼数据”
未来医疗数据价值化的核心,不是谁能把原始数据搬出来,而是谁能把医院里的原始数据加工成合规、标准、可验证、可复用的数据产品。
这条链条至少包括十个环节:

  1. 数据资源盘点
  2. 公共数据与非公共数据分流
  3. 数据分类分级
  4. 伦理审查与合法授权
  5. 数据标准映射
  6. 专病表型和结局变量设计
  7. 脱敏匿名化与重识别风险评估
  8. 专家标注与质量控制
  9. 数据知识产权登记或数据产品登记
  10. 可信数据空间内的授权使用、审计和交付

也就是说,真正有价值的不是“卖数据”,而是建设一套医疗数据产品化能力。

医院需要的是资产化能力;医生需要的是科研和成果转化激励;药企和器械企业需要的是真实世界证据能力;AI公司需要的是可训练、可验证、可持续迭代的数据底座;监管部门需要的是可控、可审计、可追溯的安全机制。

这几方利益如果不能同时被满足,高质量医疗数据集就很难持续产生。
07
结论:医疗AI的下一场竞争,不是模型参数,而是数据工程

过去几年,大家都在讨论谁的大模型更强、参数更多、推理能力更好。
但在医疗行业,真正决定上限的,很可能不是模型,而是数据。

没有本土高质量数据集,欧美模型的偏差就难以消除;没有可信数据空间,医院数据就不敢被使用;没有数据产品化机制,医院就没有动力长期治理数据;没有收益分配和成果转化机制,医生就不可能持续参与标注和质控;没有多中心、长期、标准化的专病队列,中国就很难形成真正属于自己的医学AI底座。

所以,中国医疗AI最关键的问题不是“有没有数据”,而是:
能不能把海量原始医疗数据,从“系统沉淀物”变成“合规数据资产”;能不能把医院里的死数据,炼成可训练、可验证、可流通、可复用的高质量数据集;能不能让数据不出域,但价值真正出域。
这才是医疗数据要素价值化的真正主战场。
政策已经把问题摆上了台面。接下来,比政策文本更重要的是三件事:

  • 能不能建立医院和医生愿意参与的数据收益机制
  • 能不能用可信数据空间真正降低医院法务和信息安全顾虑
  • 能不能围绕具体专病场景,跑通从数据治理、数据登记、场内交易到模型训练和真实世界证据生成的闭环

如果这三件事跑通,中国医疗AI才可能从“模型应用”进入“数据底座”阶段。
否则,我们仍然会拥有世界级的数据存量,却继续缺少真正可用的高质量医疗数据集。


免责声明:

智慧医疗网转载其他网站内容,出于传递更多信息而非盈利之目的,内容仅供参考。版权归原作者所有,若有侵权,请联系我们删除。

本平台所发布信息的内容和准确性由提供消息的原单位或组织独立承担完全责任!

凡来源注明智慧医疗网的内容为智慧医疗网原创,转载需获授权。

Copyright © 2022 上海科雷会展服务有限公司 旗下「智慧医疗网」版权所有    ICP备案号:沪ICP备17004559号-5