医院每天都在产生大量数据。病历、检验、检查、影像、手术记录、用药信息、随访结果……这些数据过去主要服务于诊疗、管理和科研。随着数据要素相关制度逐步完善,它们的价值边界正在发生变化。
2024年12月,首都医科大学宣武医院与北京国际大数据交易所合作,完成北京市首笔公立医院数据交易。此次交易涉及2500余例颈动脉支架手术病例,涵盖疾病信息、检验检查、医学影像和治疗数据,相关数据将用于国产颈动脉支架产品研发。
值得关注的并不只是“医院数据完成了一笔交易”。
更值得医院管理者和临床科室关注的是:这批进入流通环节的数据,并不是从医院信息系统中临时导出的一批原始病历,而是在长期临床实践基础上形成的专病数据集,并经过匿名化、数据清洗、整合和标准化处理。
这一区别,恰恰说明了临床数据从“资源”走向“资产”的关键所在。
一、医院不缺数据,真正稀缺的是能够持续利用的高质量数据
很多医院,尤其是大型三甲医院,并不存在“没有数据”的问题。
真正的问题是,大量临床数据产生以后,仍然分散在HIS、EMR、LIS、PACS
以及随访表格、科研EXCEL等不同载体中。
这些数据首先是为了完成诊疗过程而产生,而不是按照某一科研问题、疾病队列或者产业应用需求设计的。
这也是为什么病例数量不能直接等同于数据价值。
一批数据能否真正用于临床研究、真实世界研究、预测模型开发乃至进一步的数据应用,核心取决于它是否经历了持续、规范的数据治理。
换句话说:
医院真正需要建设的,不是一个“存病例的数据库”,而是一套能够持续形成高质量临床研究数据的机制。
二、宣武医院案例背后,真正值得关注的是“专病数据集”
宣武医院案例之所以具有代表性,一个重要原因在于数据不是为一次交易临时准备的。
医院依托长期开展的颈动脉支架手术和临床实践,持续积累相关病例,并形成了较为完整的颈动脉支架手术数据集。在进入进一步应用前,又经过匿名化、清洗、整合和标准化处理。
这意味着,一批临床数据从产生价值到释放价值,至少需要经历三个层次。
第一层,是临床数据的持续沉淀
围绕一个疾病或者一类患者,持续记录诊疗全过程。
例如对于一个心血管专病队列,真正有研究价值的数据往往不仅包括诊断结果,还需要进一步覆盖人口学特征、既往史、危险因素、实验室检查、影像结果、治疗方案、手术信息、不良事件以及长期随访结局。
只有形成连续的数据链条,才能回答疾病发生、治疗反应和长期预后等问题。
第二层,是数据治理
数据积累下来以后,还要进一步解决标准、质量和合规问题。
包括统一数据元和定义、规范疾病和操作编码、处理缺失和异常数据、建立逻辑核查规则、保留数据修改记录,以及根据具体使用场景进行隐私保护和权限控制。
在这个阶段,原始诊疗数据才逐渐转化为能够被统计、被分析、被复用的研究数据。
第三层,才是数据应用
完成前两个阶段后,同一套专病数据可以进一步服务于不同研究问题。
既可以开展回顾性队列研究,也可以进一步开展真实世界研究、长期预后研究、危险因素分析;如果样本量、变量质量和结局数据满足方法学要求,还可以进一步开展临床预测模型研究。
因此,专病数据库的价值,并不取决于一次项目能够产出什么,而在于它是否能够成为一个持续产生研究问题和科研成果的数据底座。
三、从“数据资源”到“数据资产”,中间至少隔着一道数据治理
近几年,“数据资产”成为医疗行业的高频词。
但对于医院而言,数据资产化不应简单理解成“把医院数据拿去交易”。
从目前的数据要素制度来看,更准确的理解是:在合法合规的前提下,通过明确数据资源持有、加工使用以及数据产品经营等相关权益,提升数据的可治理、可使用、可证明和可流通能力。
2024年发布的《“数据要素”三年行动计划(2024—2026年)》已经将医疗健康列入12个重点领域,并提出有序释放健康医疗数据价值、加强医疗数据融合创新。
2026年7月,《数据产权登记工作指引(试行)》正式印发,进一步建立统一的数据产权登记规则。9月11日,国家数据产权登记服务系统上线试运行,数据产权登记开始进入全国统一制度落地阶段。国家数据局同时明确,登记凭证可进一步应用于数据流通交易、数据资产入表、融资担保、作价入股、纠纷解决等场景。
这些变化意味着一个非常现实的问题:
未来,真正具有应用价值的临床数据,需要从产生之初就考虑标准化、完整性、质量、权限、使用边界和可追溯性。
如果数据长期以非结构化、非标准化方式沉积在不同系统里,需要使用时再临时抽取、临时整理,不仅科研效率低,也很难形成稳定、可复用的数据资源。
因此,从医院和科室的角度看,数据资产建设真正应该前移。
不是等到出现数据交易或者成果转化需求以后再开始治理数据,而是在专病数据库建设阶段,就逐步形成规范的数据采集和治理体系。
四、一套成熟专病库的价值
专病库能支撑“数据库—研究—模型—成果”的连续转化
这也是目前专病数据库建设正在发生的另一个变化。
过去,很多科室建库的目标比较单一——“先把病例收起来,以后写文章用”。
现在,更成熟的建设思路开始从单一项目数据库,转向长期疾病队列和学科数据基础设施。
它的价值可以沿着一条相对清晰的路径不断延伸。
第一步:形成标准化专病数据库。
围绕优势病种确定数据范围、核心变量、结局指标和随访周期,逐步形成稳定的疾病队列。
第二步:形成可持续的临床研究能力。
通过长期积累,可以不断从临床数据中发现问题,例如不同治疗路径的疗效差异、危险因素与疾病进展的关系、特定人群的长期预后等。
在这一阶段,数据库可以支撑回顾性研究、前瞻性队列研究、IIT及真实世界研究等不同研究设计。
第三步:进一步开展预测模型等成果研究。
当数据库拥有相对完整的基线资料、临床指标和结局数据后,可以进一步开展风险预测和预后研究。
例如围绕疾病进展、术后并发症、再入院、复发、生存结局等临床问题,通过合理的变量筛选和统计建模,建立风险预测模型。
需要特别强调的是,预测模型只是数据应用的一种成果形式,而不是建库的终点。
真正高质量的数据库,还可以继续支持模型外部验证、新研究假设验证、多中心研究以及后续科研项目申报。
第四步:反过来支撑学科建设。
当一个科室长期围绕优势病种形成稳定的数据队列,它能够支持的不只是论文数量。
数据库可以进一步沉淀疾病谱特征、诊疗路径、疗效评价和患者长期结局,为课题申报、多中心协作、临床研究平台建设以及优势病种研究方向形成提供基础。
于是,一条更完整的路径逐渐清晰:
临床诊疗→专病数据库→数据治理→研究队列→统计分析/预测模型→论文与课题→多中心研究与成果转化
数据不再随着某一个科研项目结束而结束,而是不断进入下一轮研究。
这才是专病数据库真正具有长期价值的地方。
五、专病数据库建设的难点
从“有没有系统”转向“能不能持续形成高质量数据”
现实中,很多数据库最后没有真正使用起来,并不是因为医院缺少软件。
问题往往发生在更早的环节。
例如,建库初期没有明确研究目标,指标设置过多;不同人员对字段定义理解不一致;历史病例整理高度依赖人工;缺少持续随访,只有基线数据没有结局;质量问题没有及时发现;项目几年以后,已经无法追溯某个字段为什么被修改。
因此,一个能够长期运行的专病数据库,至少需要同时解决四类问题:
标准化。
明确核心数据元和定义,使不同时间、不同人员甚至不同中心采集的数据可以进行比较。
持续采集。
降低临床数据整理和录入成本,使数据库能够跟随诊疗过程持续更新,而不是依赖一次性人工补录。
质量控制。
建立逻辑核查、质疑、修改、复核和操作留痕机制,使数据质量能够被持续管理。
长期随访。
围绕疾病特点设计随访周期和结局指标。对于预测模型、预后研究和真实世界研究而言,长期结局往往比单纯扩大病例数量更重要。
六、领术智慧EDC
围绕上述问题,领术智慧EDC专病数据中心的设计重点,并不是简单完成“病例存储”,而是覆盖从建库、采集、治理、随访到科研应用的一系列环节。
在数据标准层面,平台参考国内外医疗数据标准建立数据体系,涉及ICD-10、ICD-9-CM-3、LOING等标准,并建立标准术语集、数据集和数据元体系,为不同项目的数据标准化和后续科研协作提供基础。
在数据采集环节,平台可以借助自研AI大模型对病历及检查资料进行拍照识别和结构化录入,录入时间可从5分钟/例提升至30秒/例,提升10倍;在数据质量管理环节,通过系统质疑与人工核对相结合,提升效率。
针对长期队列建设,平台同时支持随访计划、随访提醒以及多中心成员协作;在数据安全和权限方面,可按照团队、项目、中心设置权限,并支持本地化部署和敏感信息脱敏。
其核心目的,是帮助科室形成一套可以持续运行的数据工作流:
从研究问题出发设计数据库👉在临床过程中持续沉淀结构化数据👉通过质控和稽查改善数据质量👉通过随访补充疾病长期结局👉最终再围绕数据库开展选题、统计分析和科研成果产出。
领术智慧EDC可覆盖专病库方案设计、数据库建立、数据采集、稽查、统计分析到论文及科研项目等后续应用环节。
结语
宣武医院的案例提供了一个值得观察的样本。
一批临床数据能够进入更高层次的应用,并不是因为医院突然拥有了“数据资产”,而是因为临床实践长期形成的数据经过了持续积累、专业治理和规范处理。
从这个角度看,数据资产并不是专病数据库建设之外突然出现的一个新概念。
高质量专病数据库,本身就是临床数据价值不断向上延伸的重要基础。
对于医院和科室而言,现在更值得思考的问题或许已经不是:“我们有多少病例?”而是:
这些病例能否持续形成标准、完整、可追溯的数据?这些数据能否反复支撑新的临床问题和科研研究?五年以后,它们能否成为科室真正能够持续利用的数据基础?
从专病数据库,到研究队列;
从研究队列,到预测模型和科研成果;
再从科研数据,走向更广泛的数据应用。
这可能才是临床数据真正从“沉淀下来”走向“产生价值”的完整路径。