OMICSDESK生信分析交付

同一批细胞里,RNA 和 ATAC 给出的细胞类型一致吗?

多组学最值钱的地方不是「染色质打开→基因表达」这句话,而是两个测量来自同一个细胞、一致性第一次可以直接量。用公开数据量了两次,结果都不如宣传里那么好看。

Multiome(同一个细胞同时测 RNA 和 ATAC)通常被一句「染色质打开、基因就表达」带过。这句话不假,但它不是你多花那笔钱换来的东西。真正值钱的是:两个测量来自**同一个细胞**,所以「它们是否一致」第一次成了可以直接量的东西,而不是拿两批实验对着猜。

先说结论:我们在公开的 10x PBMC 3k Multiome 上量了两次。① 同一批细胞,只用 RNA 聚类和只用 ATAC 聚类,一致性只有 ARI 0.553;② 被广泛用来给 ATAC 标细胞类型的「基因活性」分数,和实测表达的相关整体只有 0.178,而且 37.6% 的基因是负相关。这两个数都不是坏消息,但它们必须写进报告 —— 否则读者无法判断你给出的细胞类型是被哪一半数据定义的。

一 · 两个模态各自聚类,结果差多少

只用 RNA 聚,得到 11 个群;同一批细胞只用 ATAC 聚,得到 14 个群。两种标注之间 ARI 0.553(NMI 0.733)。大的谱系是对得上的,分歧在**边界画在哪里**:中位的那个 RNA 群有 77% 的细胞落在同一个 ATAC 群里,而最差的一个只有 48% —— 它被染色质劈成了两半。

这意味着「这个细胞是什么类型」在相当程度上取决于你用了哪一半数据。论文里几乎从不写清楚是哪一半在主导,而读者没有别的办法知道。所以这件事该写进方法学:**聚类用的是 RNA、ATAC,还是两者联合**。

二 · 「基因活性」到底有多可靠

基因活性 = 数一数某个基因附近有多少开放的峰,用它来代替表达量给细胞标类型。我们用文件自带的坐标(基因体上下游各 2 kb)给 21,682 个基因算了一遍,再和实测表达在各细胞群之间做相关。整体中位相关只有 0.178。

但平均数掩盖了真正有用的那件事。按「这个基因附近到底有几个峰」分层:

附近峰数基因数中位相关负相关比例
1 个11,3760.11341.8%
2 个4,5790.21235.7%
3–5 个2,1140.33828.6%
6 个以上1,0450.51918.0%

中位数的基因**只有 1 个附近的峰**。对这些基因,基因活性接近噪声;而对那 1,045 个覆盖较好的基因,相关能到 0.519。也就是说:**基因活性可靠不可靠,是这个基因覆盖度的属性,不是方法的属性** —— 而这个数几乎从不和结论一起报出来。用它给细胞标类型之前,先看看你依赖的那几个标志基因附近有几个峰。

三 · 质控要过两遍

Multiome 有一种单模态流程发现不了的失败:一个细胞在 RNA 上很好、在 ATAC 上很差,或者反过来。公开数据的 2,711 个条码里,有 41 个 RNA 不合格而 ATAC 正常,76 个 ATAC 不合格而 RNA 正常。两边都得剔掉,而报告里应该写清楚各因为什么原因剔了多少。

四 · 一个真实的坑:官方数据自带的指标文件整列是 0

这份 10x 官方参考数据自带的 per_barcode_metrics.csv 里,gex_umis_countgex_genes_count 66 万行**全是 0** —— 列在、名字对、类型对,就是没填,而同一行的 gex_raw_reads 是有值的。任何按 gex_umis_count >= 1000 过滤的流程都会**静默丢掉 100% 的细胞**,而且不报任何错。

正确的做法是:凡是要拿来当过滤判据的列,先检查它是不是整列为零,是就拒绝使用、改从矩阵自己算。这是平台厂商自己的参考数据集;客户文件里出同类问题只会更隐蔽。

验收清单

  1. 两个模态各自的质控指标,以及各因为什么原因剔掉了多少细胞。
  2. 聚类到底是谁定义的:RNA、ATAC,还是联合。
  3. 若用了基因活性,附上每个关键基因附近的峰数。
  4. 两种模态标注之间的一致性(ARI 或等价指标),而不是一句「结果高度一致」。

完整例子、代码和每个数字都在multiome 样品页(英文)。手上有 multiome 数据、希望结论扛得住审稿,发过来拿一份固定报价

需要人替你做,而不是看怎么做?

我们只做分析,不卖测序:把表达矩阵、h5ad/Seurat 对象或公开数据编号发过来, 拿回可直接投稿的图、结果表、方法学段落,以及产出这些结果的完整脚本。开工前先给固定书面报价。

→ 拿一份固定报价 · 看 12 份公开数据上真跑出来的样品

其他中文内容