两张 Hi-C 热图使用同一参考基因组,为什么仍不能直接相减
同为hg38只说明坐标体系一致。跨实验比较还要对齐样本、有效接触、分箱与距离背景,验证重复性并处理跨数据集偏差。
团队拿到两个都标注为 hg38 的接触矩阵,把同一坐标的格子逐个相减,并把最亮的差值直接解释成处理效应。。两张图的横纵轴都能落到同一条染色体,格子尺寸看起来也一样,于是“相减”显得像一个自然步骤。
参考基因组一致只是坐标前提;跨实验差异还必须控制样本组成、文库质量、有效接触、分箱、距离背景与标准化,先证明技术可比,才能讨论生物变化。
hg38 统一的是坐标,不是实验尺度
参考基因组回答的是读段应落到哪条染色体、哪个位置。两个实验都使用 hg38,确实消除了一个重要歧义:同一个 bin 不会因为参考版本不同而指向不同序列。但这只是比较成立的第一层条件。
一个格子的数值还取决于细胞组成、交联与酶切、文库复杂度、重复读段、有效配对数、测序深度、过滤规则和归一化方法。坐标一致并不会让这些量自动相等。
把它想成两张使用同一地图坐标的夜间照片。街道位置对齐,不代表曝光时间、镜头、天气和拍摄高度相同。逐像素相减会同时留下真实灯光变化与拍摄条件差异;Hi-C 矩阵也有类似问题。
参考版本只把读段映射到同一坐标;距离背景、覆盖和技术流程仍会改变每个格子的期望计数,因此原始逐格差值混合了技术尺度与生物变化。
先确认比较的是同一种样本问题
差异分析的第一张表不应是热图,而应是样本表。列出细胞或组织来源、处理条件、采样时间、批次、重复类型、细胞纯度,以及每个条件下是否有独立生物重复。
细胞组成尤其重要。一个处理组若含有更多处于某个细胞周期阶段的细胞,接触图变化可能来自组成迁移,而不是单个细胞内染色质结构被处理改变。不同实验室、不同批次或不同培养状态也可能把技术变化叠加到条件变化上。
同一实验拆分出的伪重复可以检查计算流程与抽样噪声,却不能替代独立建库的生物重复。伪重复共享上游误差,通常会显得过于一致;它适合当上界,不适合证明处理效应可推广。
因此,在看差值之前先问:两组是否只改变了研究问题中的一个主要条件?若样本组成与处理同时改变,后续统计只能描述“这两组矩阵不同”,不能把全部差异归因给某一处理。
热图亮度不能直接当作接触增强
热图颜色通常映射原始计数、平衡后值、观察值与期望值之比,或经过对数变换的结果。两张图若颜色范围分别自动缩放,肉眼看到的“同样亮”甚至不表示数值相同。
先确认两张图展示的数值类型、色阶上下限、零值处理和变换方式。若一张使用原始计数、另一张使用矩阵平衡结果,即使都标注 40 kb 分辨率,也不是同一统计量。
原始总读段数也不是最合适的尺度。应比较通过比对、去重复、配对过滤后真正进入接触矩阵的有效相互作用,并记录顺式与反式比例、重复率和不可用片段。一个测得更多却高度重复的文库,信息量未必高于读数较少但复杂度更好的文库。

距离衰减会制造“看起来很相关”
Hi-C接触频率具有强烈距离衰减,无关细胞类型也可能因此获得很高的Pearson相关。靠近主对角线的短距离接触数量大、计数高,容易主导全矩阵相关;两个生物上不同的样本只要共享这一物理背景,总体相关也可能很漂亮。
HiCRep 的论文给出一个直观例子:hESC 与 IMR90 的跨细胞类型 Pearson 相关与 hESC 生物重复相近。普通相关在这里主要捕捉共同的距离背景,没有可靠地区分重复和非重复。
所以不能用“Pearson 大于某个数”直接宣布两组可比。至少要按基因组距离查看接触衰减曲线,确认两组短程、中程和长程的背景是否一致;如果衰减曲线本身不同,逐格差值会系统性偏向某些距离。
专用重复性指标回答的是另一类问题
普通Pearson相关容易被短距离高计数主导,Hi-C专用方法则通过距离分层、平滑、网络或谱结构判断重复性;两者回答的问题不同。
HiCRep 先平滑局部矩阵,让连续结构不被单格抽样噪声支配,再按距离分层计算相关并汇总为 SCC。GenomeDISCO、HiC-Spector 和 QuASAR-Rep 使用不同的结构表达,但目的相同:不让一个普通相关数字忽略 Hi-C 的二维、距离依赖与稀疏特性。
Genome Biology 的基准研究在真实与模拟数据中比较这些方法。HiCRep、HiC-Spector 和 GenomeDISCO 在该研究的设置下,即使降到 500 万条相互作用,仍能区分生物重复与非重复;Pearson 在最高覆盖时也做不到同样区分。这里的 500 万不是通用门槛,它说明的是专用指标与普通相关在任务上确实有差别。
重复性检查应按染色体与距离查看,不能只保留一个全基因组平均值。某些染色体、距离段或结构层级失配时,平均数可能把问题藏起来。
覆盖量与分辨率必须一起决定
低接触计数既可能表示缺少接触,也可能来自抽样不足;提高分辨率会在固定测序量下加重矩阵稀疏。把 40 kb 矩阵切成 10 kb,格子数量大幅增加,同样的有效接触会分散到更多位置,零值和小计数自然变多。
因此,两组都提供 10 kb 文件,并不表示两组都真正支持 10 kb 的稳定比较。较浅的一组可能在该尺度主要显示抽样空洞,较深的一组则能保留局部结构;直接相减会把“一个被采到、一个没采到”画成显著差异。
先把较深样本随机下采样到共同有效接触数,再在几个候选分辨率下比较重复性和结构稳定性。若结果在 40 kb 稳定、到 10 kb 就随下采样大幅波动,应把主要结论留在 40 kb,而不是用更细的格子制造精确感。
HiCRep 的深度实验也显示,重复性随下采样下降;深测序样本可能出现平台,浅样本则在原始深度仍未饱和。饱和位置依赖样本与分辨率,不能照抄别人的读数。

各自归一化不等于两者可比
许多流程会分别对每张矩阵做 ICE、KR 或其他平衡。这样能缓解单张矩阵内部的可见偏差,却不能保证两张矩阵之间的尺度与距离趋势已经对齐。
单独归一化每张矩阵不能自动消除限制酶、建库、批次和处理流程造成的跨数据集偏差。HiCcompare 的论文特别指出,限制酶、交联、建库与处理差异如果未经处理,可能被误当成生物学差异。
在 MD 图中,M 表示两张矩阵的对数差值,D 表示相互作用距离。HiCcompare 用 loess 拟合差值随距离的系统趋势,再对两张矩阵做联合校正。其重点不是宣称任何一种方法适合所有实验,而是强调跨数据集偏差必须在比较框架内处理,不能只看每张图各自“已经归一化”。
方法选择要与实验设计匹配。只有一对已处理矩阵时,可使用适合成对比较的工具;有多个生物重复时,应使用能显式建模重复、离散度和批次的差异框架。不能为了得到差值而丢掉重复层级。
同倍数差异不代表同等证据
同样从1到10和从10到100具有相同倍数差,但后者由更多读段支持,局部差异的证据强度并不相同。
低平均计数区域对单个读段非常敏感。一个样本多出几条配对就可能产生很大的倍数变化;在高平均计数区域,同样倍数变化需要更多独立观察支持。差异检验因此要同时看效应大小、平均强度与不确定性。
HiCcompare 在差异步骤中考虑平均接触强度,并允许过滤低平均计数;它还按距离进行多重检验校正。无论使用哪种工具,原则都相同:不能把颜色最亮或倍数最大的少数格子直接列为“最强生物效应”。
零值不是一个简单的生物学否定
两个矩阵中的零可能有三种含义:真实接触很弱、测序没有抽到、或该位置在过滤与可比范围之外。若只有一组为零,差值尤其容易被夸大。
先检查该 bin 是否具有足够可比性,例如可比对性、黑名单、结构变异和拷贝数变化。癌细胞或高度重排样本中的 CNV 会同时改变局部读段供给与接触计数;若不单独标记,差异可能反映拷贝数而非三维结构调控。
若两组在大片区域呈现相同方向的计数偏移,先排查批次、覆盖和拷贝数,而不是逐格解释。真实局部变化通常还应获得邻近结构、重复一致性或正交实验支持。
一份可执行的比较前检查表
第一步,锁定分析单位:相同参考版本、染色体命名、染色体集合、bin 起点与宽度、顺式距离范围。任一项不同都先重建为统一矩阵,不在导出的图片上补救。
第二步,对齐样本与文库信息:条件、批次、生物重复、限制酶、有效配对、重复率、顺反式比例和文库复杂度。把明显不可比的样本在分析前标记出来。
第三步,统一覆盖和分辨率:把较深重复下采样到共同有效接触数,在多个分辨率检查稀疏、距离衰减与结构稳定性。保留能被所有样本支持的尺度。
第四步,验证重复性:用 Hi-C 专用方法比较同条件生物重复,同时查看各染色体和距离段。重复失配时先找样本交换、文库质量或批次原因,不急着做条件差异。
第五步,选择跨数据集归一化与差异模型:说明处理的是原始还是平衡后计数,如何控制距离背景、批次和低计数,怎样利用重复估计变异。

第六步,预先登记排除范围:CNV、黑名单、低可比对区、覆盖不足区和不满足模型假设的距离。排除理由应在看结果前确定,避免只删掉不符合预期的区域。
第七步,报告效应、证据与边界:同时给出差异方向、效应量、计数支持、重复一致性和多重校正结果,不只展示一张挑选过色阶的热图。
先统一染色体集合、分箱与有效接触深度,检查下采样和Hi-C专用重复性,再做联合归一化、计数过滤、距离分层检验与多重校正。
什么情况下仍然不能下结论
Hi-C专用重复性通过不等于存在某个具体生物差异;缺少生物重复、样本组成不一致或高分辨率极度稀疏时,差异结论仍应收窄。
只有单个处理样本和单个对照样本时,可以描述候选差异并为后续实验排序,但不能声称它是稳定、可推广的处理效应。重复性指标证明的是技术与结构一致程度,不替代条件差异的统计证据。
两组协议完全不同但生物问题重要时,也不必放弃比较。可以先降到双方共同支持的粗分辨率,限制在稳定距离段,用联合归一化和敏感性分析检验结论是否随方法改变;最终表述应保留“跨协议比较”的限制。
如果一个差异只在某个色阶、某个分辨率或某种过滤下出现,它更适合称为候选信号。若在生物重复、多个合理尺度与正交证据中方向一致,才逐步提高结论强度。
不要先合并重复再忘记变异
为了得到更饱满的热图,研究者常把同条件重复相加后再比较。合并确实能增加计数,却会同时抹去重复之间的波动;最后只剩一张处理矩阵和一张对照矩阵,差异模型无法判断某个局部变化是否稳定出现。
更稳妥的顺序是先保留每个重复,分别完成相同过滤、分箱和质量检查,再用重复性指标确认同条件样本是否一致。差异模型需要重复时,让模型在重复层级估计变异;合并图可以作为展示,但不应替代统计输入。
若某个重复明显偏离,不能只因它让结论不显著就删除。应先检查样本身份、有效接触、距离曲线、批次和文库质量,并记录排除规则。只有预先定义的技术失败证据成立,才有理由把它从主要分析中移出。
用敏感性分析检查结论是否依赖单一参数
一个可信差异不应只存在于唯一的 bin 大小或唯一的归一化选择。可以预先选两到三个由覆盖支持的分辨率,比较差异方向、受影响区域和主要结构是否一致;同时在合理的低计数过滤与距离范围内重复分析。
敏感性分析不是要求所有格子完全重合。粗分辨率会合并局部信号,不同方法也可能强调不同结构;重点是中心判断是否在合理参数变化后仍成立。若方向反转、显著区域大幅漂移或只剩边界格子,结论应降为方法依赖的候选结果。
报告时把主要分析和敏感性结果并列,说明哪些结论稳定、哪些只在特定条件出现。这样读者看到的不只是最后一张图,还能判断结果对覆盖、分辨率与模型选择有多敏感。
结论:先证明可比,再解释差值
同为 hg38 是必要条件,却只解决“格子指向哪里”。真正决定能否相减的,是这些格子是否来自可比样本、相同分析单位、共同支持的覆盖与分辨率,以及经过距离和跨数据集偏差处理后的同一种统计量。
好的分析顺序不是先画差值图再寻找解释,而是先验证样本、文库、深度、距离背景和重复性,再选择差异模型。这样得到的热图可能没有原始相减那么醒目,却更接近研究真正想回答的问题。
本文的边界是:不得把同一参考版本等同完整可比;不得把批次差异直接写成处理效应;不得用单个相关系数替代局部结构核查;不得在缺少重复时声称稳定差异。
资料来源
- Genome Research:《HiCRep: assessing the reproducibility of Hi-C data using a stratum-adjusted correlation coefficient》,发布或更新于 2017-11-01
- Genome Biology:《Measuring the reproducibility and quality of Hi-C data》,发布或更新于 2019-03-19
- BMC Bioinformatics:《HiCcompare: an R-package for joint normalization and comparison of HI-C datasets》,发布或更新于 2018-07-31