OMICSDESK生信分析交付

手上的 bulk 数据做反卷积够不够,还是必须补单细胞?

反卷积比重新做单细胞便宜得多,对某些问题确实够用,对另一些则会给出一个自信但错误的数字。用留出样本做的基准告诉你分界线在哪。

如果已经有 bulk RNA-seq,用反卷积估细胞比例的成本只是新做一批单细胞的零头。有些问题这样就够了,钱不该花;有些问题它会给你一个很自信的错数。分界线是可以事先判断的。

先说结论:反卷积对「丰度高的细胞类型发生大幅变化」是可靠的,对「小差异、稀有细胞、以及细胞状态」不可靠。我们用留出样本做的基准里,整体相关 r = 0.77、典型误差 7.5 个百分点,但有一个丰度最高的细胞类型被系统性高估了九个百分点以上。

这个基准到底测了什么

大多数反卷积对比是循环论证:参考集和测试数据来自同一批样本,等于让方法在见过的数据上考试。我们把 8 个供体拆成两半 —— 4 个供体的细胞建参考集,另外 4 个供体的细胞合成 30 份已知组成的混合样本,方法从未见过这 4 个人。这才是真问题:换成别人的组织,它还准不准。

  • 估计值与真值的整体相关:r = 0.77
  • 典型误差:7.5 个百分点
  • 表现最好:B 细胞(r = 0.93,误差 6.2 个百分点)。
  • 表现最差:CD14+ 单核细胞 —— 真值均值 15.2%,估计均值 24.6%,在丰度最高的髓系群体上系统性高估九个百分点以上。

什么时候反卷积就够了

  • 常见细胞类型的大幅变化。某处理让一个群体从 10% 涨到 20%,几个百分点的误差盖不住它。
  • 大队列筛查。手上 200 份 bulk,想知道哪些样本在免疫构成上不一样 —— 这是唯一负担得起的做法,而且「对 200 份大致判对」比「对 3 份精确判对」更有用。
  • 先生成假说,之后再正经验证。作为便宜的第一遍完全站得住,只要文章里就是这么写的。

什么时候不够

  • 差异小于方法误差。15% 到 18% 落在噪声里,报出来报的是方法不是生物学。
  • 稀有细胞群。低于几个百分点的类型估得又差又不稳,1% 的群体翻倍是找不回来的。
  • 任何关于细胞状态的问题。反卷积给的是比例。要问某个细胞类型有没有「变了」(激活、耗竭、应激),比例回答不了,换参考集也没用。
  • 没有匹配参考的组织。准确度取决于参考集像不像你的组织。PBMC 的参考很成熟,很多实体组织并不是。

怎么做决定

  1. 先写下「小到多少就不会改变你的结论」。如果这个数在丰度高的细胞类型上小于约十个百分点,光靠反卷积定不了。
  2. 问清楚问题是「有多少」还是「变成了什么状态」。只有前者是反卷积能答的。
  3. 真用反卷积,就要求报告里带**留出数据上的基准**,而不是拿建参考集的同一批样本算出来的相关系数。
  4. 常见的中间路线:挑少数代表性样本做单细胞,建一个和你组织匹配的参考,再拿它去反卷积已有的 bulk 队列。通常远比全部做单细胞便宜,而且和两个极端都不是一回事。

上面这个基准的代码和每个细胞类型的数字都在反卷积样品页(英文)。手上有 bulk 数据、正在犹豫要不要补单细胞,把问题描述发过来 —— 先弄清楚该做哪个,比两个里随便做一个都值钱。

需要人替你做,而不是看怎么做?

我们只做分析,不卖测序:把表达矩阵、h5ad/Seurat 对象或公开数据编号发过来, 拿回可直接投稿的图、结果表、方法学段落,以及产出这些结果的完整脚本。开工前先给固定书面报价。

→ 拿一份固定报价 · 看 12 份公开数据上真跑出来的样品

其他中文内容