论文信息标题Resolving sensitivity, specificity and signal contamination in Xenium spatial transcriptomics41块肿瘤切片、27位患者、三大主流基因面板——这份迄今最全面的Xenium空间转录组学基准测试揭开了数据中一个隐秘的真相你看到的“细胞信号”可能有一半来自邻居的“RNA泄漏”。一句话速览研究团队构建了包含41块乳腺癌和肺癌切片的超大Xenium数据集系统评估了平台性能和信号污染问题。他们发现转录本“溢出”是空间转录组数据中普遍存在的系统性噪声尤其会严重干扰T细胞等低RNA含量细胞的真实信号。团队提出SPLIT方法——一种基于单核RNA测序参考的纯化策略——能有效分解混合信号揭示被掩盖的T细胞耗竭等关键生物学特征。你的空间转录组数据真有那么“干净”吗空间转录组学正以前所未有的精度描绘组织中的基因表达图谱。Xenium、MERSCOPE、CosMx等成像平台甚至能做到单细胞乃至亚细胞级别的分辨率。然而分辨率高就一定意味着数据“干净”吗一个不那么令人舒服的事实是你的数据很可能被污染了。这种污染并非实验操作失误而是源于一个基础性的物理问题——你的RNA正在“串门”。当一个细胞比如肿瘤细胞大量表达某些基因时它的RNA转录本并不会安分地待在自己的边界内。它们会溢出到周围邻居的地盘上尤其是那些体积较小、RNA含量较少的免疫细胞如T细胞。你看到的某个T细胞里冒出的肿瘤标志物信号可能只是对面那个肿瘤细胞“漏”过来的。这并非假说。来自洛桑大学医院和瑞士癌症中心的研究团队在《自然·方法》上发表了迄今为止最全面的Xenium空间转录组学基准分析不仅证实了这种“转录本溢出”的普遍性还提出了一个优雅的解决方案——SPLIT。研究团队对来自27位捐赠者的41块乳腺和肺癌组织切片使用了Xenium的靶向Lung/Breast面板、Custom IO面板以及5K PRIME面板进行检测并匹配了snRNA-seq和IHC数据进行验证。隐形的“RNA邻居效应”想象一下你正在开一场摇滚音乐会肿瘤细胞鼓手在狂敲高表达基因。坐在隔壁的图书馆T细胞里那些震耳欲聋的鼓声RNA转录本不可避免地会飘进来。现在如果一个外部观察者算法只通过分贝仪基因表达检测来判断图书馆里发生了什么他很可能会错误地认为——哦图书馆里也有摇滚乐手。空间转录组学的“污染”正是这个道理。研究团队发现Xenium数据中普遍存在转录本错误分配即一个细胞的RNA信号被错误地分配给了它的邻居。这种“邻居效应”并非偶然而是与细胞类型高度相关。团队巧妙地利用RCTD一种用于空间转录组学去卷积的算法的双峰模式将每个Xenium细胞建模为“主要细胞类型w1”和“次要细胞类型w2”的混合体。次要权重w2就是衡量污染的标尺。他们发现w2与细胞局部邻域内该类型的丰度高度相关。换言之如果一个T细胞周围全是疯狂“高歌”的肿瘤细胞它的w2就高污染就重。通过计算“溢出指数”肿瘤细胞无疑成为了“最吵的邻居”它们溢出RNA的能力远超其他细胞类型。为什么这很重要因为被污染的T细胞会被错误地打上“肿瘤”或“上皮”基因标签。你以为是T细胞在攻击肿瘤实际上你看到的“武器”可能是从肿瘤那里“借来”的。更糟的是这会让后续的细胞通讯分析、细胞状态推断变得毫无意义。精准净化SPLIT登场既然污染源于混合那么“分解”便是解法。研究团队提出了SPLITSpatial Purification of Layered Intracellular Transcripts一个简洁而高效的信号净化框架。它的核心逻辑非常直观既然我们可以通过RCTD知道每个细胞里“掺杂”了什么邻居次要类型以及掺杂了多少w2权重那为什么不把这些杂质按比例清理掉SPLIT的运作机制分析混合对每个Xenium细胞RCTD提供一个“配方”这个细胞由80%的CD8 T细胞和20%的肿瘤细胞组成w10.8, w20.2。参考画像获取纯净的snRNA-seq参考数据知道“纯CD8 T细胞”和“纯肿瘤细胞”各自的基因表达谱。逐点净化对于细胞的观测表达量SPLIT根据上述配方和参考谱计算出一个“净化因子”。这个因子本质上是一个比率——混合信号中有多少比例是真正属于主要细胞类型的。然后它用这个因子乘以每一个基因的表达量。公式虽然简单但效果显著。更重要的是SPLIT足够智能。它有一个“免责”机制——如果发现一个细胞可能是真正的“双峰”比如正在分裂的肿瘤细胞被误判为肿瘤细胞和循环淋巴细胞的混合它就不会强行净化从而避免了过度校正带来的生物学信息丢失。研究团队对SPLIT与ResolVI、ovrlpy等主流校正方法以及ProSeg、Baysor、Segger等高级分割算法进行了全面对比。一场全方位的性能“锦标赛”SPLIT的表现如何团队进行了一场空间转录组学领域的“铁人三项”比赛从细胞类型分离度、批次效应、数据保留率三个维度将SPLIT与其他方法ResolVI、Ovrlpy以及不同分割策略ProSeg、Baysor、Segger进行了全面对比。结果很直观净化后信号更清晰在UMAP可视化中经过SPLIT处理的数据不同细胞类型的簇分离得更加明确。与真实参考更接近SPLIT处理后的T细胞其基因表达谱与纯snRNA-seq数据Chromium的余弦相似度最高说明它更接近“真实情况”。最少的“误伤”相比ResolVI和Ovrlpy会大幅减少细胞的检测基因数使许多细胞变成“空细胞”SPLIT在去除污染的同时最好地保留了数据完整性。尤其值得注意的是即便是针对细胞核0μm扩展的分割这种被认为污染较轻的策略仍然存在可检测的污染而SPLIT能够对其进行进一步净化。被“净化”后世界重新清晰了纯净的数据是为了发现真实生物学。SPLIT的价值在分析T细胞耗竭这一关键生物学问题上得到了完美验证。当T细胞靠近肿瘤细胞时它们分化的路径往往指向“耗竭”——一种功能减退的状态是免疫治疗失败的重要原因。但在原始数据中靠近肿瘤的T细胞混杂了大量肿瘤细胞信号导致耗竭信号被淹没。SPLIT登场后效果立竿见影去伪存真SPLIT成功去除了T细胞中伪阳性的肿瘤和上皮基因特征。再现经典净化后的T细胞其与恶性细胞的空间邻近关系清晰地揭示了T细胞耗竭特征的增强包括经典的耗竭标志物HAVCR2、CTLA4、PDCD1、LAG3和CXCL13的上调。超越前辈相比之下其他校正方法要么校正不彻底要么“一刀切”地把真正的T细胞信号也一并消除。*这项研究表明如果不进行有效的信号纯化基于空间转录组学推断细胞通讯的结果可能充满误导。正如作者强调这对于当前正在兴起的基于大规模空间转录组数据训练的基础模型而言尤为重要——如果训练数据本身就存在系统性污染模型学到的“规律”将是什么局限与未来空间组学的“清洁之道”作为一项严谨的研究文章也坦诚指出了SPLIT的局限性。它依赖于一个高质量的snRNA-seq参考数据集这意味着它假设参考中包含所有相关的细胞类型。如果遇到参考中不存在的特殊状态如特定的循环肿瘤细胞SPLIT可能会产生错误的分解。目前的方法主要针对二维空间数据的污染对于三维空间中的复杂溢出效应仍有待进一步探索。写在最后总的来说这项研究不仅提供了空间转录组学领域最详实的基准测试更给出了一个切实可行的工具。它提醒我们在赞叹技术进步带来的海量数据时必须警惕那些隐形的“信号窃贼”。SPLIT的出现为我们开启了一扇通往更纯净、更真实的分子世界的大门。不过一个深层的问题也随之浮现当我们校正了RNA的物理溢出排除了技术噪音我们是否也可能在某些场景下不自觉地“校正”掉了细胞之间真实的、微弱的通讯信号比如T细胞通过胞外囊泡接收的少量肿瘤抗原信息在追求数据纯净的道路上我们该如何在“去除污染”和“保留真实生物学”之间划下那条精巧的界限欢迎在评论区分享你的思考。