OMICSDESK生信分析交付

单细胞质控阈值该怎么定,以及怎么向审稿人交代

为什么「线粒体<5%」这类固定阈值在很多组织上是错的,如何用数据本身定阈值,以及报告里该写哪些数字。

所有教程都用同一组阈值:每个细胞至少 200 个基因、不超过 2,500 个基因、线粒体比例低于 5%。对 PBMC 这是合理起点。在别的组织上它错得足够频繁,以至于照抄是分析被打回的常见原因之一。

固定阈值为什么会错

线粒体比例依赖组织。心肌细胞、肝细胞、骨骼肌线粒体极多,健康细胞落在 20–40% 都正常。套一个 5%,你会把要研究的细胞类型删掉,然后报告说它很稀有。反方向也会出错:轻柔解离的淋巴细胞可能只有 2%,但仍然处在线粒体比例反映不出的应激状态。

基因数上限本意是抓双细胞,但浆细胞、巨核细胞天然就比静息 T 细胞表达多得多的基因。一个全局上限,系统性地删掉的是那些大而活跃的细胞。

该怎么做

按样本、从数据里定阈值。在每个样本内部算各项指标的中位数绝对偏差(MAD),剔除超出 3 个 MAD 的细胞。它随组织和批次质量自适应,而且好解释——因为它是一条写得出来的规则,不是口味。

双细胞交给双细胞检测器,不要交给基因数上限。scDblFinder、DoubletFinder、Scrublet 都能从数据本身模拟双细胞并打分。液滴平台上大致每上样 1,000 个细胞带来 0.8% 的双细胞率——1 万个细胞就是约 8%,这个量级不可能靠一个基因数天花板处理掉。

环境 RNA 单独处理。高线粒体和「背景污染」是两个问题。SoupX 或 CellBender 估计并扣除环境成分;它需要未过滤的原始矩阵,所以别只留过滤后的那份。

看联合分布。把线粒体比例对 UMI 数画出来。将死的细胞集中在低计数、高线粒体那个角;健康的大细胞在高计数、中等线粒体。单轴阈值分不开,二维一看就分开了。

顺序也重要

先去空液滴(它们不是细胞),再扣环境 RNA,再测双细胞,最后做细胞层面的质量过滤。把质量过滤提前会毁掉环境 RNA 的估计——因为模型需要那些低计数液滴来估背景。

报告里写什么

一张按样本的小表:过滤前细胞数、过滤后、剔除比例、中位基因数、中位 UMI、中位线粒体比例、用了什么阈值。任何一个样本剔除超过约 20%,加一句解释——通常是解离问题,主动说出来远好过被审稿人发现。

最后,把主结论在另一组阈值下再跑一遍,写一句「结论不变」。这一句能挡掉本领域最常见的那条审稿意见,成本是一个下午。我们把这件事做成了默认交付项,这里是在公开数据上跑的实测:主结构稳定,但宽松阈值多出一个血小板群——严格阈值把这个真实的小群整个删掉了。

需要人替你做,而不是看怎么做?

我们只做分析,不卖测序:把表达矩阵、h5ad/Seurat 对象或公开数据编号发过来, 拿回可直接投稿的图、结果表、方法学段落,以及产出这些结果的完整脚本。开工前先给固定书面报价。

→ 拿一份固定报价 · 看七份公开数据上真跑出来的样品

其他中文内容