假设要建立一套肺结节AI数据集,用于患者首次CT发现结节后的恶性风险评估。为了提高标签可靠性,项目只纳入取得病理结果、资料完整的病例。
这样做便于确认诊断,也便于专家复核。但进入随访观察、没有接受取材或转到其他医院的患者,可能被排除在外。
最终得到的数据集,能够支持哪些判断?它在已经取得病理结果的患者中表现良好,是否足以说明它适合初次发现结节的人群?
这需要从样本形成的过程寻找答案。
医疗数据集的质量,既取决于每条记录是否可靠,也取决于患者为什么有机会进入这套数据。
在数据集建设中,选择偏倚涉及一个核心问题:患者进入或留在样本中的过程,是否使研究结果、风险估计或性能评价偏离了原本要回答的问题。
判断之前,必须先明确目标人群。
如果数据集用于某类拟接受手术患者的术前评估,围绕相应诊疗路径收集病例,可以有合理依据。若用途是初次发现肺结节后的风险判断,就需要考虑尚未接受进一步检查或取材的人群。
两种用途面对的患者不同,对样本的要求也不同。
因此,样本与某个人群存在差异,并不意味着所有分析都有偏倚。需要进一步判断:这种差异是否影响当前任务,以及结论能否适用于预期使用人群。
STARD诊断准确性研究报告规范要求说明患者的纳入条件、识别方式和临床环境,目的之一就是帮助读者判断偏倚风险与结果的适用性。¹
建设之初,应当把“用于什么患者、在诊疗的哪个环节使用”写清楚,再确定纳入规则。
胸外科接诊患者、呼吸科门诊患者和体检发现肺结节的人群,经历的诊疗过程不同。
患者是否被转诊、是否接受进一步检查、是否进入手术流程,都受到此前临床判断的影响。到数据导出时,一部分选择已经完成。
检查记录也有类似特点。某项检验是否被开具、某次影像是否被复查,可能与医生怀疑的疾病、患者病情和后续就医安排有关。日常诊疗数据记录的是医疗服务发生的过程,采集方式与研究或模型开发的需要并不天然一致。²
这对数据提取有一个直接影响:“具有某项检查记录”本身就可能是一条临床筛选条件。
例如,以“完成某项进一步检查”作为病例检索入口,得到的首先是进入该检查流程的人群。能否用这批数据评价更早环节的患者,需要另外论证。
项目中值得追问的一句话是:这条数据,在什么情况下才会被记录下来?
理解记录产生的条件,才能解释数据库中缺少了哪些人。
病理结果可以为相应病变提供重要的诊断依据。问题在于,目标人群中的患者并不一定都有病理结果。
在开头的假设项目中,是否接受取材,可能与病变特征、临床怀疑程度、身体状况和患者选择有关。因此,有病理结果者与没有病理结果者,未必是可以直接互换的两组患者。
如果评测只分析获得参考标准结果的人,就需要考虑部分确证偏倚。方法学研究指出,仅分析参考标准结果完整的患者,可能使诊断准确性估计产生偏倚;影响的方向和程度取决于缺失机制,不能统一判断为指标升高或降低。³
这里需要分别回答两个问题:病例的诊断依据是否充分,以及这批病例是否适合评价目标用途。
对缺少确证结果的患者,应保留其证据状态。没有病理结果,不能直接等同于良性;没有确诊记录,也不能直接等同于没有疾病。
若采用符合任务要求的随访结果或其他参考依据,应说明确认规则与局限。参考依据不同,需要评估其影响,不宜在数据加工时直接抹平差别。
“关键字段齐全”“影像能够匹配”“随访达到规定时长”,都是可以理解的数据质量要求。
但这些条件同时决定了哪些患者能够留下来。
假设一套数据只保留检查充分、且连续在本院复查的患者,跨院就诊、检查较少或随访中断的人就可能被排除。如果这些情况与病情、结局或目标使用人群有关,完整病例未必能够支持原定的评价结论。
删除缺失记录是否产生偏倚,需要结合缺失机制与分析目标判断。缺失与临床过程有关时,直接删除可能改变样本构成和分析结果。²
因此,每增加一项完整性要求,都应检查它排除了哪些患者。
随访尤其需要区分“没有记录”与“没有事件”。本院没有后续记录,可能涉及转院、停止复查或其他原因,不能据此直接判定目标结局未发生。
还要注意,随访完整性筛选与信息泄漏是两个问题。前者影响谁进入样本;后者涉及模型是否使用了预测时点尚不可获得的信息。未来随访可以用于确认预测结局,但不应提前进入当时无法获得这些信息的模型输入。²
如果训练集和测试集都来自同一批手术确证病例,即使按照患者严格切分,评测结果仍主要反映模型在这类患者中的表现。
扩大样本量,可以提高某些估计的精度,却无法仅凭数量补足从未进入样本的人群。
多中心数据也需要做同样的检查。如果各家医院都采用相近的转诊和纳入路径,某些覆盖缺口可能共同存在。因此,医院数量之外,还应了解不同中心实际提供了哪些患者。
这里还需要区分训练用途与评测用途。
训练集可以根据学习目标,有目的地增加某些病例或困难样本。用于估计目标场景总体表现的评测集,则需要关注抽样方式与实际使用人群的关系。专门富集高风险病例的挑战集,可以用于发现薄弱环节;其结果应单独解释,不能直接替代目标人群中的总体性能评价。
样本是否适合,最终要对应它承担的任务。
实际建设中,可以从用途说明、筛选记录和验证设计三个环节入手。
项目启动时,先写清目标人群、使用时点和需要支持的判断。以肺结节为例,“初次发现结节后的风险评估”与“完成专科检查后的术前评估”,应有各自的样本设计。这个区别需要在检索病例之前确定。
数据筛选时,保留主要纳入和排除步骤的人数与原因,并检查筛选前后人群构成的变化。例如,增加完整随访要求后,就诊来源或病情分布是否发生明显变化?如果发生了变化,应进一步判断其与目标任务的关系。RECORD报告规范也要求说明研究人群的形成过程,包括数据质量、可获得性和记录关联对筛选的影响。⁴
验证和交付时,把已经覆盖的人群与尚缺证据的人群分别说明。能够补充数据的,安排针对性补充;暂时无法补充的,应限定当前版本的适用范围,避免把结论延伸到未经验证的场景。
统计调整可以在相应条件下帮助处理部分问题,但依赖可获得的信息和方法假设。它不能代替对缺失原因的了解,也不能保证消除所有偏倚。³
这些工作最终应进入数据集说明书和质量报告。使用者需要据此判断:现有数据可以承担哪些任务,哪些应用还需要补充证据。
回到开头的案例,手术病理病例可以构成有价值的数据资源。其适用范围,应由临床用途、样本形成过程和验证结果共同支持。
一套高质量医疗数据集,应当让使用者看清样本从哪里来、经过怎样的选择,以及这些选择对结论有什么影响。
选择过程决定哪些患者进入数据集。进入之后,同一位患者的多次就诊如何组织,同样影响数据的可靠性。
上一讲:《落地观察丨医保数据价值挖掘进入落地期:从结算记录到支付、医药与保险决策》
下一讲:《一位患者,多次就诊:纵向医疗数据集如何保留病程与时间关系》。
继续讨论事件发生时间、信息记录时间和结果可获得时间如何区分,以及这些时间关系怎样影响训练与评测。
文中肺结节项目为方法学示例,不对应具体项目结果。所引报告规范用于支持方法学讨论,不等同于医疗数据集认证或验收标准。
免责声明:
智慧医疗网转载其他网站内容,出于传递更多信息而非盈利之目的,内容仅供参考。版权归原作者所有,若有侵权,请联系我们删除。
本平台所发布信息的内容和准确性由提供消息的原单位或组织独立承担完全责任!
凡来源注明智慧医疗网的内容为智慧医疗网原创,转载需获授权。