HKBEUPENCRYPTED RESEARCH TRANSFER

版本治理

不同参考基因组版本为什么不能直接混用

坐标看起来相同,实际可能指向不同序列、缺口和染色体命名体系。

坐标只有结合版本才有意义

hg19与hg38之间存在序列修订、缺口变化和替代区域。chr1上的同一数字位置在两个版本中不一定代表相同片段。矩阵、BED文件和基因注释若来自不同版本,叠加结果可能出现系统偏移。

文件名应明确写出参考版本,项目元数据还要保存索引来源和构建日期。单写“human”不足以复核分析。

坐标转换不是无损操作

liftOver等工具可以映射许多区间,但重复序列、重排和缺失区域可能无法一对一转换。Hi-C分箱跨越较长区间时,转换后的边界还可能改变分箱结构。

无法映射的区间应保留记录,不能静默删除后继续比较。转换前后都要统计覆盖率,并对关键区域人工核对。

项目迁移时固定参考环境

客户端换机或迁移计算节点时,参考序列、Bowtie 2索引、染色体长度文件和注释版本应成组迁移。只复制分析脚本会让新环境自动使用另一个默认版本。

HK-BEUP交付清单可以把参考环境列为独立对象。接收端先验证小范围结果,再启动全量矩阵计算。

染色体命名也会造成失败

`chr1`与`1`、线粒体名称和替代序列写法不同,都会让工具误判区间不存在。转换前应统一命名规则,同时保留原始名称以便回溯。

BAM header、BED文件、染色体长度表和矩阵索引必须指向同一体系。只修改文件表面文字而不更新索引,会留下更隐蔽的错误。

跨物种项目更需要明确映射

人和小鼠的同源区域不能通过坐标直接比较。研究需要独立的同源关系、链文件或保守区间定义,并说明一对多映射如何处理。

若映射覆盖率低,结论应限制在可可靠对应的区域。无法映射的部分本身也可能有生物意义,不应为了得到整齐矩阵而删除记录。比较结果还应区分保守结构与物种特异区域,避免把缺少映射误写成结构消失。映射工具、链文件版本和失败区间数量也应完整进入项目摘要。