Practice

MPN 临床数据与研究平台合作实践

与长治医学院附属和平医院围绕骨髓增殖性肿瘤开展合作,参与数据治理、数据库规划与研究平台路线设计。

目录
目录

合作背景

2024 年 7 月,团队开始与长治医学院附属和平医院围绕骨髓增殖性肿瘤(MPN)开展合作讨论。现有项目记录覆盖了研究问题梳理、临床数据清洗、专病数据组织和研究平台规划等工作。

这是一项仍在推进的合作实践,现阶段聚焦数据治理、专病数据库与研究平台规划。

实践时间线

  • 2024-07-22:首次形成明确合作记录,主题为骨髓增殖性疾病。
  • 2024-07-23:开展初次讨论并整理工作方案。
  • 2024-10-12:梳理数据规模、基础设施和技术服务等关键问题。
  • 2024-11-07:进一步明确“数据库优先”的第一阶段思路。
  • 2025 年:持续形成总体工作方案、临床数据清洗方案和专病数据平台规划。

为什么先做数据库,而不是先做模型

合作早期提出过药物预测、多模态融合和智能分析等方向。但这些属于路线设想,不等于已经完成的系统。

在临床研究环境中,更基础的问题是:

  • 数据分散在哪些业务系统和表格中;
  • 同一研究对象在不同来源中如何对应;
  • 日期、单位、编码和缺失值是否一致;
  • 哪些字段可以进入研究环境;
  • 如何记录数据版本、清洗规则与访问过程。

如果这些问题没有解决,模型会把数据质量问题包装成看似精确的结果。因此第一阶段将重点放在数据目录、标准、清洗和数据库结构上。

临床数据治理中的核心问题

统一研究标识

门诊、住院、检验和检查数据可能使用不同编号。公开研究数据中不应沿用姓名、证件号码等直接身份字段,而应在受控环境内完成映射,并生成去标识化的研究编号。

对外分析表只保留研究所需字段,身份映射由授权系统单独管理。

建立数据字典

每个字段需要记录:

  • 业务含义和来源系统;
  • 数据类型、单位和允许值;
  • 缺失值与异常值规则;
  • 更新时间和时间粒度;
  • 是否属于敏感字段;
  • 清洗前后字段的映射关系。

没有数据字典时,同名字段可能含义不同,不同名称也可能实际指向同一指标。

让清洗过程可以复查

临床数据清洗不仅是删除空值。每条规则应记录输入、输出、修改原因和影响行数,例如:

原始数据快照
→ 字段映射
→ 编码与单位统一
→ 重复记录处理
→ 时间逻辑检查
→ 质控报告
→ 研究数据版本

原始数据保持只读,研究数据版本可以重新生成。

平台结构的阶段性思路

现有方案把平台拆成几个层次:

  1. 源数据层:保存受控的原始数据快照。
  2. 标准化层:完成标识映射、字段统一和质量检查。
  3. 研究数据层:按研究问题生成去标识化数据集。
  4. 分析层:支持统计分析、组学整合和可复现流程。
  5. 展示层:只呈现经过审核的汇总结果和研究报告。

结构化元数据可以进入关系型数据库;较大规模的分析数据可根据实际查询方式选择分析型存储。具体技术选型应由数据规模、更新频率、访问模式和运维能力决定,而不是先确定工具再寻找场景。

我的参与内容

我参与或持续推进了:

  • MPN 研究需求与数据需求的拆解;
  • 临床数据清洗关系梳理;
  • 数据库与研究平台的阶段性架构;
  • 数据量、基础设施和实施顺序的讨论;
  • 项目方案与阶段性材料的整理。

药物预测、个体化推荐与虚拟患者等方向处于后续研究设想阶段。

这项合作带来的认识

临床数据项目首先是治理项目

数据库、模型和可视化只是表面。真正决定研究能否开展的是标识体系、数据标准、权限边界、质量规则和版本记录。

研究平台与临床系统必须区分

研究平台可以帮助形成假设和分析证据,但不能自动获得临床诊断或治疗用途。任何面向临床使用的功能都需要额外的验证、合规与责任边界。

大路线需要拆成可验收的小阶段

相比一次性规划完整智能平台,更可执行的顺序是:

数据盘点
→ 数据字典
→ 清洗与质控
→ 研究数据库
→ 可复现分析
→ 经验证的扩展应用

每一阶段都应有可检查的输入、交付物和验收条件。

数据安全与隐私保护

临床数据处理遵循去标识化、最小必要字段、受控访问和全程留痕原则。身份映射与原始临床资料在授权环境中独立管理,研究数据按版本生成并接受质量检查。

建议阅读