MIMIC-IV作为重症医学领域极具权威性和实用性的公开临床数据库,承载着海量真实患者的诊疗数据,是临床科研、医学数据分析领域的核心资源。对于初次接触该数据库的研究者而言,解压后繁杂的文件目录、英文缩写命名的数据表、庞大的数据体量,往往会让人陷入无从下手的困境,难以快速厘清数据结构、明确各表单的用途与使用规范。为帮助科研使用者快速入门、高效拆解数据库核心内容,本文将系统解析MIMIC-IV v3.1版本的整体文件架构、核心目录功能、辅助文本文件作用,并细致拆解hosp模块全部数据表的分类、字段价值与使用注意事项,为后续数据筛选、清洗、建模分析奠定基础。
一、下载后的 MIMIC-IV 数据
如果你刚刚拿到 MIMIC-IV 这个数据库,第一件事大概是解压,然后打开文件夹——看到两个目录、几十个后缀为 csv.gz 的文件,文件名大多是英文缩写,完全不知道从哪下手。这篇文章要解决的就是这个问题。
MIMIC-IV 是麻省理工学院计算生理学实验室维护的重症监护数据库,数据来自波士顿贝斯以色列女执事医疗中心。目前最新的版本是 2024 年 10 月发布的 v3.1。它把十几万名患者的真实住院过程,拆成了 31 张可以互相连接的表格。