欢迎访问智慧医疗网 | 网站首页
 
当前位置:首页 > 资讯 > 观点

国家卫健委说的高质量数据集,和医院理解的可能不是一回事:AI-Ready 是道新门槛

发布时间:2026-08-24 来源:创新RWD 浏览量: 字号:【加大】【减小】 手机上观看

打开手机扫描二维码
即可在手机端查看

今年 6 月,国家数据局那份编号 25 号的文件里出现了一个词:AI-Ready。它意味着"高质量数据集"的验收线被抬高了。本文用结直肠癌 ERAS 这一个具体场景,把从立项到冻结的完整流程走一遍,包括新增的那条线要多做什么。

国家数据局印发的这一份文件,编号国数科基〔2026〕25 号,名字很长——《关于推进行业高质量数据集建设行动的实施方案》。这类文件在医药行业通常激不起什么水花,因为它归口在"数据"而不在"医疗"。但这一份值得看,里面写了一个词:AI-Ready。

方案给的目标期是 2028 年底,医疗卫生位列 19 个重点领域之一。更早半年,国家卫生健康委等五部门那份"人工智能+医疗卫生"的实施意见把时间点定得更近:2027 年建成一批高质量数据集和可信数据空间,2030 年二级以上医院九成以上要在影像和临床决策支持上用起 AI。

这两个时间点之间,隔着一件相当不性感的工作——把医院里已经存在的数据,变成能喂给模型的数据集。

01
"高质量数据集"这个词,含义变了


2018 年的 GB/T 36344 给的是六个维度:规范性、完整性、准确性、一致性、时效性、可访问性。标准不算低,但目标很清楚,是"数据本身没毛病"。
去年 7 月中国信通院牵头的《人工智能高质量数据集建设指南》,把维度扩到 12 个一级、36 个二级。新进来的几项很说明问题:稠密性、多样性、均衡性、可溯性。这几个词跟"数据对不对"关系不大,跟"模型能不能学"关系极大。
到今年 6 月那份实施方案,说法进一步收敛成四句话:结构完整性、内容多样性、标注准确性、模型适配性。连测评方法也换了,叫"数据质量验证 + 模型应用反馈"。翻译过来就是:光跑规则不算数,得拿模型跑一遍看效果。
对医院来说这是个不小的转变。过去建专病库,验收基本按科研那一套走:人群定义清楚、结局判定可靠、结果能复现,对着 STROBE 核对表过一遍差不多就行了。现在多出一条线,而且这条线上很多要求,在原来的流程里压根没人负责。
微信图片_2026-08-24_095327_771.jpg

02
为什么拿结直肠 ERAS 做例子

今年 ERAS Society 在《Surgery》上发了新版择期结直肠手术围术期指南,把一批推荐调得更细:术后不再常规留置胃管,结肠微创 24 小时内拔尿管、直肠微创 48 小时内,术后第一天起每天离床活动不少于 3 小时。这种颗粒度的推荐,天然就是可测量的字段。
更关键的是,ERAS 这套东西从诞生起就带着 audit 的基因:测依从性、找短板、改流程、再测一遍。它要的不是结局数据,是过程数据。而过程数据,恰恰是各家医院最缺的东西。

03
七个阶段,一个个说

微信图片_2026-08-24_095331_799.jpg
立项:最容易被跳过、代价最大的一步
不是变量设计,是定索引事件。
ERAS 数据集里几乎每个变量都带时间属性:术前 2 小时碳水负荷、术后 24 小时内拔尿管、术后第一天下床。如果没统一定义 T0 是哪个时刻,不同的人会分别按入院日、手术日 0 点、麻醉诱导、切皮来算。三个人录一年数据,出来的依从率彼此之间没有可比性。
这件事的代价是不对称的。定义它,只需要在章程里写一行字,外加在表单每页页眉重复一遍;不定义它,整个数据集报废。
纳入排除标准同理。"排除急诊手术"这句话本身没错,但没用——录入的人得知道在数据里怎么判定"急诊":看入院类型字段,还是看术前诊断有没有梗阻穿孔?每条标准后面都得跟一句可执行的判定规则。
变量字典:定义要经得起"两人独立填"的检验
检验方法很简单:同一份病历交给两个人,各自按定义独立填,看结果一不一样。
"术后早期经口进食"过不了这个检验。早到什么时候?喝水算不算?漱口咽下去算不算?两个人给出两个答案,最后依从率能差二十个百分点。
改成这样就过得了:自 T0 起 24 小时内,护理记录中出现至少一次经口摄入流质或口服营养补充剂,单纯饮水与漱口不计。取值 1 是、0 否、8 无法判定。
顺带说个很小但很致命的约定:缺失编码。空白、0、9、8 这四个必须分开。空白是"还没采",0 是"确实做了判定,结果是否",9 是"结构性不适用",8 是"病历信息不足判不了"。不少团队图省事,把"没做"记成空白,结果依从率的分子分母同时失真,事后无从补救。
还有个分母的坑:算依从性总分时,"不适用"不能进分母。糖尿病患者不做碳水负荷是合理的,把这一项算进分母,等于惩罚了执行规范的科室。
采集:先做那道分工题
在设计表单之前,先算清楚这些变量分别从哪儿来。大致会分成三类。
微信图片_2026-08-24_095335_345.jpg
约六成能从 HIS、LIS、手麻系统直接抽出来:人口学、检验值、手术起止时间、体温监护点。约两成半躺在手术记录和病理报告的自由文本里,需要规则或 NLP 先抽一遍再人工确认。剩下一成半系统里根本没有,必须人工前瞻录入,包括 ERAS 依从性各项、并发症分级裁决、术后随访。
很多团队把大部分精力耗在前面那六成上,反复导数、清洗、对表。可那部分再怎么打磨,也只是把已有的东西搬得整齐一点。真正决定这份数据集值不值钱的,是最后那 15%。
而这 15% 里还有一条更实际的建议:别等事后回病历里找,把采集点前移到临床工作流里去。
与其让人三个月后翻护理记录去猜"术后第一天到底下床没有",不如推动在电子护理单的活动记录里加一个结构化的时长字段,把 ERAS 各项做成临床路径表单里的勾选项。数据在诊疗当下顺手产生,质量最高、成本最低,而且这么做本身就改善了临床执行。这正是 ERAS audit 的本意。
微信图片_2026-08-24_095339_476.jpg
建库:三层不能跳,版本必须冻
原始层留原样、只增不改;标准层做编码映射和去标识化;分析层放派生变量。分析层里每一个值,都要能顺着映射表回到源表、源字段、源记录 ID。做不到这一点,任何一次认真的稽查都过不去。
另一件常被忽略的事是冻结。分析永远针对一个带版本号的快照,而不是"今天的数据库"。否则半年后重跑,结果不一样,谁也说不清哪里变了。
质控:真正拉开差距的是并发症裁决
三道防线:录入时硬校验直接拦下,每周跑一遍规则集派发问询单,每月抽 5% 的病例做源数据核查。这些都是常规动作。真正把普通导出表和高质量数据集区分开的,是并发症怎么定。
常见做法是把并发症等同于出院诊断,这会系统性低估——大量Ⅰ到Ⅱ级的事件根本不进诊断列表。稳妥的做法是两名外科医生独立读全程病历,包括影像、检验、再手术记录和护理记录,各自做 Clavien-Dindo 分级,不一致时由第三人仲裁,全程留裁决日志。定期算两人的一致性系数,目标是 0.80 以上。低于这个数,说明定义本身没写清楚,该回去改定义,而不是换人重判。
这件事很费人,但目前没有替代方案。
验收与运营
验收逐项打勾并附实测值:核心变量缺失率、硬校验违反数、核查一致率、随访完成率、派生脚本能否重跑复现。有一条要写死——验收不通过就不冻结。
冻结也不是终点。依从性数据要定期回到科室质量改进会上。重点看达标率最低的那三项,通常不是医生不愿意做,而是流程或排班上有障碍。

04
要过 AI-Ready 那条线,还得多做六件事

上面这套流程走完,你手里是一份合格的科研数据集。挑三件最反直觉的说说。
一、标注不等于录入
录入是把病历里已有的事实搬进数据库,标注是为某个模型任务生成标签。比如做手术记录的文本抽取,得在原文上标片段级实体,还要写清边界规则:"中转开腹"的触发词有哪些,否定语境怎么处理。
这需要一本成文的标注规范书,带正反例;标注员要有资质与培训记录;双人独立标注加第三人仲裁;一致性定期测量并留痕。这是一套跟数据录入完全不同的质控体系,多数医院目前没有对应的岗位。
二、数据集不能按记录随机切
同一个患者的所有记录必须落在同一个集合里。按记录随机划分,会让同一例患者的术前数据进训练集、术后数据进测试集,模型等于提前看了答案,指标很漂亮,上线就崩。
更稳妥的是时间外部验证:2023 到 2024 年的病例训练,2025 年的病例测试。这最接近模型上线之后的真实处境。如果是多中心,再留一个中心完全不参与训练。
三、别把连续值压成 0/1
这是新增的"稠密性"维度想说的事。术中体温维护,如果只留一个"达标/不达标",整条曲线就丢了;术后第一天的活动,如果只留"是/否",具体分钟数也丢了。判定值和原始连续值应该同时保留。
另外三件事简单提一句:交付数据卡片而不只是数据字典,说明适用任务、类别分布、已知局限和不适用场景;授权链与再识别风险评估要随数据集一起交付;冻结前用基线模型跑一遍,验证"场景适用性",也就是政策文件里说的那个双回路。
还有一条提醒:如果目标是拿医疗器械注册证,还要叠加药监局 2022 年那份《人工智能医疗器械注册审查指导原则》的要求——采集设备与过程的质控记录、标注人员资质、训练调优测试三集两两无交集并经查重验证、所用软件工具的名称版本制造商。这些必须在立项阶段就确认,事后几乎补不上。

05
05 十二个坑,和两周内能做的三件事

微信图片_2026-08-24_095343_193.jpg
如果只能记住几件事:定死 T0;把"没做"和"没采"分开编码;依从性项必须前瞻采;并发症要双人裁决;数据集要有冻结版本;面向 AI 使用时,按患者切分。
最后给一个很务实的起步方案。不需要预算,不需要信息科排期,一个临床团队自己就能在两周内做完。

  1. 第一周前半段,写一页纸章程。主问题一句话,纳排各不超过五条且每条附判定规则,T0 定义,五个角色写上具体姓名。一页纸写不完,说明范围还太大。
  2. 第一周后半段,先定三十个核心变量,八个属性写满。别一上来就做两百个变量的字典。
  3. 第二周,找二十份病历,两个人按字典独立填,逐字段比一致率。凡是不一致的字段,都是定义没写清楚,回去改定义,而不是去培训录入员。

这一步能省下后面几百个小时。
说句判断。未来两三年,医疗 AI 领域真正稀缺的大概不是算力,也不是模型,而是那种能把每一个字段说清楚来龙去脉的数据集。政策已经把这件事的重要性讲得很明白,剩下的问题是有没有人愿意去做那些不出彩的工作——比如坐下来,给一个变量写一句谁都挑不出毛病的定义。

免责声明:

智慧医疗网转载其他网站内容,出于传递更多信息而非盈利之目的,内容仅供参考。版权归原作者所有,若有侵权,请联系我们删除。

本平台所发布信息的内容和准确性由提供消息的原单位或组织独立承担完全责任!

凡来源注明智慧医疗网的内容为智慧医疗网原创,转载需获授权。


Copyright © 2022 上海科雷会展服务有限公司 旗下「智慧医疗网」版权所有    ICP备案号:沪ICP备17004559号-5