OMICSDESK生信分析交付

怎么挑生信分析服务商:八个能当场验证的问题

不看宣传页,只看能验证的东西。八个问题,每个都有明确的「好答案」和「该走人的答案」,以及为什么这么问。

找生信分析服务这件事,难在你要评价的恰恰是你不熟的领域 —— 如果你熟,就自己做了。所以别问「你们水平怎么样」,问那些**答案能当场验证**的问题。下面八个,每个都给了好答案长什么样、以及听到什么就该走人。

先说结论:最能分辨真假的两个问题是第 1 个(能不能拿出在公开数据上跑出来的完整例子,连脚本一起)和第 5 个(什么情况下你们会拒绝做)。前者验证「做得出来」,后者验证「知道什么时候做不得」—— 后一条更难装。

1 · 能不能给我一份完整的样品,数据是公开的、脚本能下载?

好答案:给你一个链接,里面是某份公开数据(带编号)的完整分析,每张图、每个数字都在,脚本可以下载,你自己重跑能得到同样结果。

该走人:只有几张漂亮的示意图,或者「客户案例不方便展示」。用公开数据做的样品不涉及任何保密问题,做不出来只有一个原因。

2 · 组间比较时,你们的 n 是细胞数还是样本数?

这是整个领域最常见的统计错误。把每个细胞当独立观测,样本量瞬间变成几万,p 值要多小有多小,结果不可重复。

好答案:「n 是生物学重复(供体/样本),先按样本聚合成伪批量再检验。」

该走人:「我们有两万个细胞,统计效力很足。」为什么这是错的

3 · 质控阈值怎么定的?

好答案:从你这份数据自己的分布里推(比如中位数 ± 3 MAD),并且按组织调整 —— 心、肝、肌肉、肾的线粒体比例本来就高,拿 5% 去砍会把要研究的细胞删掉。

该走人:「按标准流程,200 个基因、5% 线粒体。」这是教程里的默认值,不是判断。怎么向审稿人交代

4 · 细胞类型注释怎么验证?

好答案:手工注释之外,再跑一个**没看过这些标签**的公开参考模型,逐个群比对,并把不一致的群明确列出来。不一致不丢人,藏起来才是问题。

该走人:「按 marker 基因人工判断的。」只有人工判断,等于没有第二个意见。

5 · 什么情况下你们会拒绝做?

这一问最难装,因为它要求对方说出自己业务的边界。

好答案:能说出具体条件。比如:文件里没有样本/供体列 → 做不了条件间比较;每组少于 3 个生物学重复 → 差异检验不可解释,只能描述不能下结论;反卷积的差异小于方法误差 → 报出来报的是方法不是生物学。

该走人:「你想要什么我们都能做。」

6 · 交付里包不包括代码和参数?

好答案:包括,而且是能重跑的那种 —— 软件版本、随机种子、每一步的参数。这决定了半年后审稿人要你补一个分析时,是改两行还是从头再来一遍。

该走人:只给图和表格。那意味着每一次返修都要重新付费。

7 · 报价是固定的还是按小时?什么会让它变?

好答案:看到数据后给固定书面价,并说清楚哪些情况会触发重新报价(比如样本数变了、要加模块)。

该走人:没看数据就给一口价,或者全程按小时且不封顶。

8 · 我的数据会被怎么处理?

好答案:只用于这个项目、不复用、不转授,交付后按要求删除,并且能说清楚存在哪、谁能访问。

该走人:含糊其辞,或者条款里写着「可用于改进我们的模型」。

一句提醒

上面八条里,有六条你在第一封邮件里就能问完,而对方的回答长什么样,基本就决定了后面会发生什么。真要再省一步:直接要第 1 条那个链接,自己去看脚本。

我们自己的答案都摆在明处:13 份公开数据上的完整样品(英文,含代码)、价格、以及各类检测的质控参考值。要不要合作是另一回事,这份清单拿去问别家一样管用。

需要人替你做,而不是看怎么做?

我们只做分析,不卖测序:把表达矩阵、h5ad/Seurat 对象或公开数据编号发过来, 拿回可直接投稿的图、结果表、方法学段落,以及产出这些结果的完整脚本。开工前先给固定书面报价。

→ 拿一份固定报价 · 看 13 份公开数据上真跑出来的样品

其他中文内容