坐标只有结合版本才有意义
hg19与hg38之间存在序列修订、缺口变化和替代区域。chr1上的同一数字位置在两个版本中不一定代表相同片段。矩阵、BED文件和基因注释若来自不同版本,叠加结果可能出现系统偏移。
文件名应明确写出参考版本,项目元数据还要保存索引来源和构建日期。单写“human”不足以复核分析。
坐标转换不是无损操作
liftOver等工具可以映射许多区间,但重复序列、重排和缺失区域可能无法一对一转换。Hi-C分箱跨越较长区间时,转换后的边界还可能改变分箱结构。
无法映射的区间应保留记录,不能静默删除后继续比较。转换前后都要统计覆盖率,并对关键区域人工核对。
项目迁移时固定参考环境
客户端换机或迁移计算节点时,参考序列、Bowtie 2索引、染色体长度文件和注释版本应成组迁移。只复制分析脚本会让新环境自动使用另一个默认版本。
HK-BEUP交付清单可以把参考环境列为独立对象。接收端先验证小范围结果,再启动全量矩阵计算。
染色体命名也会造成失败
`chr1`与`1`、线粒体名称和替代序列写法不同,都会让工具误判区间不存在。转换前应统一命名规则,同时保留原始名称以便回溯。
BAM header、BED文件、染色体长度表和矩阵索引必须指向同一体系。只修改文件表面文字而不更新索引,会留下更隐蔽的错误。
跨物种项目更需要明确映射
人和小鼠的同源区域不能通过坐标直接比较。研究需要独立的同源关系、链文件或保守区间定义,并说明一对多映射如何处理。
若映射覆盖率低,结论应限制在可可靠对应的区域。无法映射的部分本身也可能有生物意义,不应为了得到整齐矩阵而删除记录。比较结果还应区分保守结构与物种特异区域,避免把缺少映射误写成结构消失。映射工具、链文件版本和失败区间数量也应完整进入项目摘要。