资讯动态

【多组学研究】组学筛选到的靶蛋白,是不是越多越好?

发布时间:2026/8/25 14:18:48 来源:尧图企业网站定制
引言做组学质谱结果回来差异蛋白列表拉出来两三百个CRISPR筛选跑完hit gene排了一页又一页。老板问“选哪个做后续”你盯着屏幕心里想的是 —— 要不都做了但真正推进过项目的人都知道候选靶点的数量和最终能走通的数量从来不是正相关。今天这篇文章我来跟大家一起认真聊聊组学筛选到的靶蛋白到底是不是越多越好▎ 一、先看一组真实数据筛选的漏斗有多残酷近期一篇CRISPR筛选hit验证的系统研究的流程数据很有代表性验证阶段剩余靶点数量主要流失原因初筛250—正交CRISPRko验证58脱靶效应、假阳性单条gRNA重复验证42gRNA特异性毒性cDNA Rescue实验31表型不可回补二级功能实验28上下游依赖效应250个初筛hit走到最后的功能确认只剩28个转化率约11%。这还是在实验设计比较规范、验证手段比较齐全的情况下。如果你的初筛名单是500个甚至1000个后面的验证工作量会指数级增长但真正能留下来的可能还是那么十几个。▎ 二、为什么“多”不等于“好”三个层面的原因1. 统计层面FDR控制的是比例不是绝对数量蛋白质组学里我们常说FDR1%很多人以为这意味着“100个蛋白里只有1个假阳性”。但仔细想如果你鉴定出5000个蛋白1%的FDR意味着里面可能有50个假阳性。放到差异蛋白筛选里当你同时检验上万个特征时即使没有任何真实差异原始p0.05也会预期产生约500个假阳性。Target-decoy策略Elias Gygi, Nature Methods 2007是蛋白质组学的标准质控手段但它控制的是全局错误率。对于你特别关心的那个亚群比如“差异倍数2且p0.01的蛋白”局部FDR可能远高于全局值。Nature Communications 2026年的一篇社区基准研究就明确指出蛋白质组层面的FDR不等于特定亚群的FDR尤其是低丰度、新注释蛋白这类子集。【一句话】FDR1%不是“几乎没有假阳性”而是“假阳性比例被控制在1%”——当基数很大时绝对数量依然可观。2. 实验层面每个靶点的验证都是真金白银拿蛋白质组学的靶向验证来说。Thermo Fisher的技术文档里写得很清楚SRM/MRM是靶向定量的金标准但方法开发是最大瓶颈 —— 你需要提前确定每个靶蛋白的特征肽段和子离子优化碰撞能量、保留时间。一个100个蛋白的panel方法开发可能需要数周。PRM平行反应监测虽然比传统SRM灵活但同样需要针对每个靶点设置隔离窗口和采集方法。Thermo最新的Stellar质谱配合PRM Conductor工具可以一次跑800肽段但这是仪器层面的通量回到实验设计你仍然需要为每个靶点准备重标肽、优化色谱条件、确认特异性。抗体就更不用说了。多克隆抗体需要逐批验证即便是单克隆抗体也必须在你的具体应用场景WB/IP/IHC中确认特异性。我自己就遇到过花了三个月验证、最后发现抗体识别的是off-target蛋白的情况。3. 功能层面相关性不等于因果性组学筛选给你的是“相关性”——这个蛋白在处理组和对照组之间有差异。但功能验证要回答的是“因果性”——改变这个蛋白会不会改变表型CRISPR筛选里这个问题尤其突出。Doench等人2016年在Nature Biotechnology上的工作表明不同sgRNA的on-target活性和off-target效应差异巨大。即便是经过优化设计的gRNA也可能因为序列同源性导致脱靶。因此建议CRISPR ko的结果用正交方法如siRNA、CRISPRi验证因为不同技术的off-target谱完全不同能交叉验证上的才是真hit。▎ 三、少而精的策略从大名单到短名单既然候选多了验证不过来那正确的做法不是“全都做”而是在筛选和验证之间加一层“优先级排序”把资源集中在最有可能走通的靶点上。1. 多组学交叉过滤用独立证据收敛候选单一维度的组学数据噪音大但如果一个靶点在多个独立层面都出现信号置信度就完全不同了。比如·基因组层面GWAS或突变数据支持该基因与疾病相关·转录组层面差异表达且方向一致·蛋白质组层面蛋白水平确实有变化注意mRNA和蛋白相关性往往只有0.4-0.6·功能基因组层面CRISPR敲除后表型显著·临床层面与患者预后或药物响应相关2. 优先级评分给每个靶点打个分我自己的习惯是建一个简单的评分表从以下几个维度给候选靶点打分每项0-2分·效应量差异倍数或表型效应大小·统计稳健性p值/FDR、重复一致性·生物学合理性已知通路/功能是否与研究问题相关·可成药性/可操作性是否有已知抑制剂、抗体或好的CRISPR设计·验证可行性是否有靠谱抗体、重标肽是否容易合成·新颖性是否有足够文献支持太少可能是假阳性太多则缺乏创新性3. 正交验证设计至少两条独立路径确定了短名单之后验证策略也要讲究。建议至少从两个独立维度进行验证具体来说·蛋白水平WB PRM/SRM靶向质谱两种方法原理不同能互相印证·功能水平CRISPRko siRNA敲低或CRISPRko cDNA回补实验·互作水平Co-IP Pull-down或邻近连接技术PLA▎ 四、实操建议1. 筛选阶段就想好验证方案不要等筛选结果出来再想“怎么验证”。在设计实验时就应该明确▶ 初筛的hit打算用什么正交方法验证▶ 抗体有没有▶ 重标肽能不能合成如果一个靶点连验证手段都没有就算排第一也很难推进。2. 设定明确的“止损线”给自己定一个规则比如初筛hit取Top 10 做第一轮验证验证通过的进入第二轮而不是全部做WB。资源有限的情况下集中火力比撒胡椒面有效得多。3. 重视阴性结果验证没通过的靶点不是“失败”而是帮你排除了假阳性。把这些数据记录下来一方面可以优化筛选参数另一方面也是论文里的重要补充材料。4. 不要迷信“大名单”的安全感很多时候我们觉得“候选多发现多”其实是一种心理安慰。真正有价值的是经过严格验证、能讲清楚机制的靶点哪怕只有一两个。一篇好论文的核心往往是1-2个深入验证的靶点而不是一张罗列几百个差异蛋白的表格。▎ 写在最后组学技术给了我们前所未有的全局视野但“看到”和“证明”之间隔着漫长的验证之路。候选靶点不是越多越好而是越经得起推敲越好。从500个到5个看起来损失了99%但留下来的那5个每一个都能撑起一个课题、一篇论文、甚至一个药物项目。而那495个被过滤掉的大部分本来就走不到最后 —— 早一点识别出来就是在节省时间和经费。与各位共勉。少即是多在组学筛选这个领域尤其如此。▎ 主要参考资料1. Elias JE, Gygi SP. Target-decoy search strategy for increased confidence in large-scale protein identifications by mass spectrometry. Nature Methods, 2007, 4(3):207-214.2. Doench JG, et al. Optimized sgRNA design to maximize activity and minimize off-target effects of CRISPR-Cas9. Nature Biotechnology, 2016, 34(2):184-191.3. Lam S, Thomas JC, Jackson SP. Genome-aware annotation of CRISPR guides validates targets in variant cell lines. Genome Medicine, 2024, 16:139.4. Community benchmarking and evaluation of human unannotated microprotein detection by mass spectrometry based proteomics. Nature Communications, 2026.5. GETgene-AI: a framework for prioritizing actionable cancer drug targets. 2025.6. Thermo Fisher Scientific. New paradigm for plasma proteomics biomarker research: large-scale targeted PRM proteomics. Technical Note TN-003861.7. Sigma-Aldrich. Improving reproducibility: best practices for antibodies. White Paper.8. IBA Lifesciences. Investigation of protein-protein interactions with Strep-tag technology. Application Guide.9. Horizon Discovery. Orthogonal validation with metastatic phenotypes using siRNA, CRISPRko and CRISPRi. Application Note.10. Minikel EV, et al. Improving the odds of drug development success through human genomics. 2020.

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价