手上的 bulk 数据做反卷积够不够,还是必须补单细胞?
反卷积比重新做单细胞便宜得多,对某些问题确实够用,对另一些则会给出一个自信但错误的数字。用留出样本做的基准告诉你分界线在哪。
如果已经有 bulk RNA-seq,用反卷积估细胞比例的成本只是新做一批单细胞的零头。有些问题这样就够了,钱不该花;有些问题它会给你一个很自信的错数。分界线是可以事先判断的。
先说结论:反卷积对「丰度高的细胞类型发生大幅变化」是可靠的,对「小差异、稀有细胞、以及细胞状态」不可靠。我们用留出样本做的基准里,整体相关 r = 0.77、典型误差 7.5 个百分点,但有一个丰度最高的细胞类型被系统性高估了九个百分点以上。
这个基准到底测了什么
大多数反卷积对比是循环论证:参考集和测试数据来自同一批样本,等于让方法在见过的数据上考试。我们把 8 个供体拆成两半 —— 4 个供体的细胞建参考集,另外 4 个供体的细胞合成 30 份已知组成的混合样本,方法从未见过这 4 个人。这才是真问题:换成别人的组织,它还准不准。
- 估计值与真值的整体相关:r = 0.77。
- 典型误差:7.5 个百分点。
- 表现最好:B 细胞(r = 0.93,误差 6.2 个百分点)。
- 表现最差:CD14+ 单核细胞 —— 真值均值 15.2%,估计均值 24.6%,在丰度最高的髓系群体上系统性高估九个百分点以上。
什么时候反卷积就够了
- 常见细胞类型的大幅变化。某处理让一个群体从 10% 涨到 20%,几个百分点的误差盖不住它。
- 大队列筛查。手上 200 份 bulk,想知道哪些样本在免疫构成上不一样 —— 这是唯一负担得起的做法,而且「对 200 份大致判对」比「对 3 份精确判对」更有用。
- 先生成假说,之后再正经验证。作为便宜的第一遍完全站得住,只要文章里就是这么写的。
什么时候不够
- 差异小于方法误差。15% 到 18% 落在噪声里,报出来报的是方法不是生物学。
- 稀有细胞群。低于几个百分点的类型估得又差又不稳,1% 的群体翻倍是找不回来的。
- 任何关于细胞状态的问题。反卷积给的是比例。要问某个细胞类型有没有「变了」(激活、耗竭、应激),比例回答不了,换参考集也没用。
- 没有匹配参考的组织。准确度取决于参考集像不像你的组织。PBMC 的参考很成熟,很多实体组织并不是。
怎么做决定
- 先写下「小到多少就不会改变你的结论」。如果这个数在丰度高的细胞类型上小于约十个百分点,光靠反卷积定不了。
- 问清楚问题是「有多少」还是「变成了什么状态」。只有前者是反卷积能答的。
- 真用反卷积,就要求报告里带**留出数据上的基准**,而不是拿建参考集的同一批样本算出来的相关系数。
- 常见的中间路线:挑少数代表性样本做单细胞,建一个和你组织匹配的参考,再拿它去反卷积已有的 bulk 队列。通常远比全部做单细胞便宜,而且和两个极端都不是一回事。
上面这个基准的代码和每个细胞类型的数字都在反卷积样品页(英文)。手上有 bulk 数据、正在犹豫要不要补单细胞,把问题描述发过来 —— 先弄清楚该做哪个,比两个里随便做一个都值钱。