空间转录组聚出来的「分区」,怎么判断是不是真的
空间聚类永远能给你分区,不管有没有意义。四步判断一个分区是组织微环境还是技术伪影,并用我们自己跑的公开数据举一个失败的例子。
空间聚类从不失败。你要十个分区它就给十个,在切片上铺得整整齐齐,看起来就是生物学。真正的问题是:这十个里哪些经得起追问。
先说结论:先看每个分区的特征基因,再看那张图。我们自己跑的公开淋巴结切片聚出 10 个分区,其中一个(248 个 spot)的全部特征基因都是线粒体基因 —— 它不是微环境,是切片上质量最差的那块。任何空间统计都发现不了这件事,而看一眼基因表只要十秒钟。
第一步 · 先读特征基因,再读图
这是最便宜也最能定生死的一步,却经常被跳过。同一张切片(质控后 4,025 个 spot,聚成 10 个分区),特征基因直接告诉你哪些是真的:
- 0 号区 —— IGHG1、IGKC、IGHG4、IGHG3:浆细胞区。真的,淋巴结本来就该有。
- 6 号区 —— CXCL13、MS4A1:B 细胞滤泡/生发中心。真的。
- 2 号区 —— TRBC1、TRAC、IL7R、CCL21:T 细胞区。真的,而且它和滤泡的相对位置是可解释的。
- 3 号区 —— MT-ND4、MT-ATP6、MT-ND3、MT-CO3、MT-CO2、MT-ND1。特征基因全是线粒体基因。这不是细胞微环境,是组织质量最差的区域。
3 号区完全可以进配图:有位置、有形状、有编号、有颜色。当成生物学解读,就会长出一个「代谢特殊区域」的故事 —— 而这个故事没有任何支撑。
第二步 · 问一句:这个分区是不是被技术梯度解释掉了
把每个分区的中位 UMI 数、中位基因数、线粒体比例和整张切片比一比。只要某个分区在任一项上处在极端,举证责任就反过来了:它需要拿出**不能被深度或损伤解释**的生物学特征基因。切片边缘、褶皱、气泡下方,都能产出看起来很像样的分区。
第三步 · 确认这些基因真的有空间结构
随机波动的基因也能被聚出分区。Moran's I 衡量一个基因的表达在空间上到底有没有组织性。同一张切片里空间自相关最强的是 IGKC(0.878)、IGHG4(0.853)、FDCSP(0.748)、CCL21(0.681)—— 滤泡和 T 区的基因,正是淋巴结该给的结果。如果一个分区赖以成立的基因 Moran's I 都接近 0,那不管图多整齐,它都是聚类的产物。
第四步 · 换个分辨率,看谁还在
分区数是参数,不是发现。把聚类分辨率调粗调细各跑一遍:真实结构会可预测地合并和拆分,伪影则会凭空出现又消失。任何针对某个具体分区的结论,都应该在一个合理范围内稳定,报告里也该写明测过哪些范围。
验收清单
- 每个分区的特征基因**全表**,不是挑过的几个。
- 每个分区的质控指标,让质量驱动的分区暴露出来而不是被藏起来。
- 结论所依赖的基因的 Moran's I(或等价指标)。
- 哪些分区在不同聚类分辨率下是稳定的。
上面这个例子的代码和每个数字都在空间样品页(英文)。手上有切片、希望结论能扛住审稿,发过来拿一份固定报价。