审稿人要求重新分析单细胞数据,怎么办
审稿意见里真正常见的五类分析要求、每一类实际要花多少时间、以及怎么答才不用把整个项目重做一遍。
几乎每篇单细胞文章返修时都会带至少一条分析要求。慌张通常比工作本身更费事——绝大多数要求落在五个筐里,其中只有一类真的意味着从头再来。
1.「质控阈值看起来是随意定的」
最常见,也最便宜。审稿人一般不是要你换阈值,而是要证据表明结论不依赖阈值。有效答复是一张小的敏感性表:换两三组阈值重跑聚类,说明聚类数和关键细胞群的 marker 是稳定的。
数字要按样本报,不要合并。如果某个样本掉了 40% 而其他只掉 5%,主动写出来——这比藏着更能建立可信度,而且它往往正好解释了审稿人接下来要问的批次效应。
我们在公开数据上把这件事做过一遍:三套阈值的实测显示主结构稳定(ARI 0.894 / 0.872),但宽松阈值多出一个血小板群——严格阈值把这个真实的小群整个删掉了。这种发现如实写进答复,比声称"我们的阈值是标准做法"有力得多。
2.「你怎么知道这些是某某细胞」
回答注释质疑要用互相独立的证据,而不是再多画几张同样三个基因的图。三条线通常能定案:经典 marker、参考数据集的自动注释(SingleR / Azimuth / CellTypist,而且要在看不到人工标签的情况下跑)、以及基因集打分。三者一致时并排放一张图;不一致的地方,那个不一致本身就是结果——含糊的细胞群该在正文里写一句,而不是给一个自信的标签。
3.「请校正批次」
这里的陷阱是过度校正。整合方法会很乐意把生物学上不同的样本揉成一团。整合前先问清楚:批次到底是什么?不同化学版本、不同实验日是真的技术批次;处理组 vs 对照组不是。整合完要检查一个你知道应该有条件特异性的细胞群有没有被抹平——如果被抹平了,你删掉的是自己的结果。
这件事可以量化:我们的实测用「同供者近邻比例」和「同处理近邻比例」两个数一起看,前者降 20.2%(批次混匀了),后者只动 −0.1%(生物学保住了)。只报前一个数的整合报告,等于只报了一半。
4.「补做拟时序 / 细胞通讯 / 通路分析」
这些是加法模块,不是重做。每个在已处理好的对象上通常一到两天。常见错误是把它们的输出当成结论而不是假设:拟时序是关于进程的假设,配体-受体打分是关于相互作用的假设。在正文里就按假设来写,审稿人反而不再纠缠。
5.「你的差异表达在统计上不成立」
这条是真问题,也是最常被答错的一条。拿三只小鼠的几千个细胞对另外三只的几千个细胞做逐细胞检验,等于把细胞当独立重复——它们不是。你的 n 是动物数或供者数,不是细胞数。正确做法是按样本把每个细胞类型的 counts 聚合成伪批量,再用 bulk 方法(DESeq2 / edgeR / limma-voom)检验。基因列表会缩水,有时缩得厉害。那不是损失,那是假阳性在离场。具体怎么做和实测差多少。
各自实际要花多久
- 质控敏感性表——半天,主要是重跑已有流程。
- 注释证据图——对象已处理好的话半天。
- 批次整合加检验——一到两天。
- 拟时序 / 细胞通讯 / 富集模块——各一到两天。
- 差异表达改成伪批量重做——一天,外加改写因此变化的结论。
唯一每次都能救你的一件事
不管自己做还是外包,坚持要求分析是可复算的:脚本、参数、软件版本和结果存在一起。第二轮审稿在三个月后,那时没人记得当初图 3 用的是哪个分辨率参数。如果你不能在一个下午内重跑,那就等于从头再做一遍。