目录
合作背景
2024 年 7 月,团队开始与长治医学院附属和平医院围绕骨髓增殖性肿瘤(MPN)开展合作讨论。现有项目记录覆盖了研究问题梳理、临床数据清洗、专病数据组织和研究平台规划等工作。
这是一项仍在推进的合作实践,现阶段聚焦数据治理、专病数据库与研究平台规划。
实践时间线
- 2024-07-22:首次形成明确合作记录,主题为骨髓增殖性疾病。
- 2024-07-23:开展初次讨论并整理工作方案。
- 2024-10-12:梳理数据规模、基础设施和技术服务等关键问题。
- 2024-11-07:进一步明确“数据库优先”的第一阶段思路。
- 2025 年:持续形成总体工作方案、临床数据清洗方案和专病数据平台规划。
为什么先做数据库,而不是先做模型
合作早期提出过药物预测、多模态融合和智能分析等方向。但这些属于路线设想,不等于已经完成的系统。
在临床研究环境中,更基础的问题是:
- 数据分散在哪些业务系统和表格中;
- 同一研究对象在不同来源中如何对应;
- 日期、单位、编码和缺失值是否一致;
- 哪些字段可以进入研究环境;
- 如何记录数据版本、清洗规则与访问过程。
如果这些问题没有解决,模型会把数据质量问题包装成看似精确的结果。因此第一阶段将重点放在数据目录、标准、清洗和数据库结构上。
临床数据治理中的核心问题
统一研究标识
门诊、住院、检验和检查数据可能使用不同编号。公开研究数据中不应沿用姓名、证件号码等直接身份字段,而应在受控环境内完成映射,并生成去标识化的研究编号。
对外分析表只保留研究所需字段,身份映射由授权系统单独管理。
建立数据字典
每个字段需要记录:
- 业务含义和来源系统;
- 数据类型、单位和允许值;
- 缺失值与异常值规则;
- 更新时间和时间粒度;
- 是否属于敏感字段;
- 清洗前后字段的映射关系。
没有数据字典时,同名字段可能含义不同,不同名称也可能实际指向同一指标。
让清洗过程可以复查
临床数据清洗不仅是删除空值。每条规则应记录输入、输出、修改原因和影响行数,例如:
原始数据快照
→ 字段映射
→ 编码与单位统一
→ 重复记录处理
→ 时间逻辑检查
→ 质控报告
→ 研究数据版本
原始数据保持只读,研究数据版本可以重新生成。
平台结构的阶段性思路
现有方案把平台拆成几个层次:
- 源数据层:保存受控的原始数据快照。
- 标准化层:完成标识映射、字段统一和质量检查。
- 研究数据层:按研究问题生成去标识化数据集。
- 分析层:支持统计分析、组学整合和可复现流程。
- 展示层:只呈现经过审核的汇总结果和研究报告。
结构化元数据可以进入关系型数据库;较大规模的分析数据可根据实际查询方式选择分析型存储。具体技术选型应由数据规模、更新频率、访问模式和运维能力决定,而不是先确定工具再寻找场景。
我的参与内容
我参与或持续推进了:
- MPN 研究需求与数据需求的拆解;
- 临床数据清洗关系梳理;
- 数据库与研究平台的阶段性架构;
- 数据量、基础设施和实施顺序的讨论;
- 项目方案与阶段性材料的整理。
药物预测、个体化推荐与虚拟患者等方向处于后续研究设想阶段。
这项合作带来的认识
临床数据项目首先是治理项目
数据库、模型和可视化只是表面。真正决定研究能否开展的是标识体系、数据标准、权限边界、质量规则和版本记录。
研究平台与临床系统必须区分
研究平台可以帮助形成假设和分析证据,但不能自动获得临床诊断或治疗用途。任何面向临床使用的功能都需要额外的验证、合规与责任边界。
大路线需要拆成可验收的小阶段
相比一次性规划完整智能平台,更可执行的顺序是:
数据盘点
→ 数据字典
→ 清洗与质控
→ 研究数据库
→ 可复现分析
→ 经验证的扩展应用
每一阶段都应有可检查的输入、交付物和验收条件。
数据安全与隐私保护
临床数据处理遵循去标识化、最小必要字段、受控访问和全程留痕原则。身份映射与原始临床资料在授权环境中独立管理,研究数据按版本生成并接受质量检查。