资讯动态

【文献分享】scDAU:基于条件扩散特征正则化与多尺度交叉模态翻译网络的单细胞跨模态翻译框架

发布时间:2026/8/28 21:58:55 来源:尧图企业网站定制
一、文章介绍单细胞多组学技术的快速发展使得在同一细胞中同时测量多种分子模态成为可能——例如通过SNARE-seq、SHARE-seq等技术同时测量基因表达和染色质可及性或通过CITE-seq同时测量转录组和表面蛋白丰度。这些配对测量提供了细胞状态的多维视图有助于精确表征调控相互作用、细胞异质性和疾病机制。然而实验性多组学分析仍面临技术挑战实验复杂性增加、技术噪声升高、成本高昂、通量和跨样本可比性受限。与此同时大量高质量的单模态数据如scRNA-seq和scATAC-seq已通过传统单组学技术生成但因缺乏互补模态而未被充分利用。这一现状催生了跨模态翻译的需求——从已有模态计算推断缺失模态从而降低实验成本并扩展现有数据的效用。近年来多种深度学习方法被提出用于单细胞跨模态翻译大致分为三类潜在空间对齐法如BABEL、scMM、MultiVI通过共享或协调表征学习进行翻译架构增强法如sciPENN、scMOG引入专门网络设计生成式方法如scButterfly、scCross、scDCT利用对抗网络或扩散模型捕捉复杂跨模态分布。然而这些方法普遍存在两个关键局限1它们往往依赖直接潜在映射和确定性重建难以充分捕获多组学数据的内在复杂性和变异性2学习到的表征常将跨模态共享生物信号与模态特异性变异包括技术噪声纠缠在一起分离不充分会损害翻译精度和泛化能力。为克服上述挑战Jialiang Xue、Xiangmei Cao及其合作者在Bioinformatics上发表了题为“scDAU: a deep learning framework for single-cell cross-modal translation via conditional diffusion-based feature regularization”的研究论文提出了一个名为scDAU的深度学习框架。scDAU的核心设计围绕三大创新。第一条件扩散特征正则化。与scDCT在潜在空间中直接用条件扩散进行翻译不同scDAU将条件扩散用作特征空间的正则化机制——在特征解耦阶段通过扩散重建约束确保提取的共享表征和模态特异性表征都信息丰富且生物学有意义而非直接用于数据生成。第二显式特征解耦策略。scDAU引入三个专用编码器RNA特异性编码器Erm\mathsf{E}_{\mathrm{rm}}Erm​、ATAC特异性编码器Eam\mathsf{E}_{\mathrm{am}}Eam​和共享语义编码器Es\mathsf{E}_{\mathrm{s}}Es​。通过零损失Lzero1c∑i∥Erm(Xia)∥1∥Eam(Xir)∥1\mathcal{L}_{\mathrm{zero}} \frac{1}{c}\sum_i \|\mathsf{E}_{\mathrm{rm}}(\mathcal{X}_i^a)\|_1 \|\mathsf{E}_{\mathrm{am}}(\mathcal{X}_i^r)\|_1Lzero​c1​∑i​∥Erm​(Xia​)∥1​∥Eam​(Xir​)∥1​处理相反模态时最小化特异性编码器输出实现稀疏诱导迫使共享编码器排除模态特异性信号、聚焦捕获共享生物信息。第三U-Net多尺度交叉模态翻译网络。基于解耦后的共享特征ZrsZ_{rs}Zrs​和ZosZ_{os}Zos​scDAU构建两个对称四层编码器-解码器的U-Net带跳跃连接分别进行RNA→ATAC和ATAC→RNA翻译。跳跃连接实现了多尺度特征融合和渐进语义对齐在保留全局语义信息的同时保持局部细节优于直接一步映射。研究者用四个公开配对多组学数据集PBMC、BMMC、MA、Chen系统评估了scDAU。在数据集内五折交叉验证中scDAU在ATAC→RNA任务中PCC达0.764比第二好方法高约6%在RNA→ATAC任务中AUROC达0.884。在跨数据集生成中scDAU是唯一在新PBMC数据集上PCC0.6的方法。在未见细胞类型生成中scDAU在所有数据集上均取得最优或接近最优性能。在BMMC-CITE蛋白组学翻译中scDAU在RNA→ADTPCC0.782和ADT→RNAPCC0.836双向任务均最优。在人胶质母细胞瘤数据中scDAU保留细胞类型特异性表达和染色质可及性模式支持下游标志物鉴定和功能富集分析。二、算法原理介绍scDAU的算法设计围绕“自编码器降维 → 条件扩散正则化解耦 → U-Net多尺度翻译”三个核心步骤展开。一模态特异性自编码器降维。RNA和ATAC数据分别通过独立自编码器投影到256维潜在空间。RNA用MSE损失Lr1C∑i∥Ri−Dr(Er(Ri))∥22\mathcal{L}_r \frac{1}{C}\sum_i \|R_i - D_r(E_r(R_i))\|_2^2Lr​C1​∑i​∥Ri​−Dr​(Er​(Ri​))∥22​ATAC用二元交叉熵损失La−1C∑i[Ailog⁡A^i(1−Ai)log⁡(1−A^i)]\mathcal{L}_a -\frac{1}{C}\sum_i [A_i\log \hat{A}_i (1-A_i)\log(1-\hat{A}_i)]La​−C1​∑i​[Ai​logA^i​(1−Ai​)log(1−A^i​)]。降维后得到XrX^rXr和XaX^aXa作为后续输入。二条件扩散正则化的特征解耦。三个MLP编码器从XrX^rXr和XaX^aXa中分别提取RNA特异性ZrmZ_{rm}Zrm​、ATAC特异性ZamZ_{am}Zam​、RNA共享ZrsZ_{rs}Zrs​、ATAC共享ZasZ_{as}Zas​。零损失Lzero\mathcal{L}_{\mathrm{zero}}Lzero​对特异性编码器处理相反模态时施加L1稀疏惩罚强制分离。共享条件扩散模型DDPM作为正则化器——对RNA用条件DDPM从[Zrm,Zrs][Z_{rm},Z_{rs}][Zrm​,Zrs​]重建X~r\tilde{X}^rX~r损失LrdiffE[∥ϵθ(Xtr,t∣Zrm,Zrs)−ϵt∥22]\mathcal{L}_{\text{r}}^{\text{diff}} \mathbb{E}[\|\epsilon_\theta(X_t^r,t|Z_{rm},Z_{rs}) - \epsilon_t\|_2^2]Lrdiff​E[∥ϵθ​(Xtr​,t∣Zrm​,Zrs​)−ϵt​∥22​]ATAC同理。DDPM前向过程q(xt∣xt−1)N(xt;αtxt−1,(1−αt)I)q(x_t|x_{t-1})\mathcal{N}(x_t;\sqrt{\alpha_t}x_{t-1},(1-\alpha_t)I)q(xt​∣xt−1​)N(xt​;αt​​xt−1​,(1−αt​)I)逐步加噪反向过程学习去噪。总损失Lλ1(LrdiffLadiff)λ2Lzero\mathcal{L} \lambda_1(\mathcal{L}_{\text{r}}^{\text{diff}} \mathcal{L}_{\text{a}}^{\text{diff}}) \lambda_2\mathcal{L}_{\mathrm{zero}}Lλ1​(Lrdiff​Ladiff​)λ2​Lzero​默认λ10.5,λ21.0\lambda_10.5,\lambda_21.0λ1​0.5,λ2​1.0联合优化。扩散重建约束确保解耦后的表征既分离又信息丰富——这是scDAU与直接用于数据生成的scDCT的本质区别。三U-Net多尺度翻译与解码。基于共享特征ZrsZ_{rs}Zrs​RNA→ATAC和ZosZ_{os}Zos​ATAC→RNA两个U-Net四层编码器-解码器跳跃连接执行翻译。每层编码器含线性变换、层归一化、SiLU激活和下采样上采样路径镜像对称并通过跳跃连接融合对应编码层特征。U-Net输出低维翻译表征X~a\tilde{X}^aX~a或X~r\tilde{X}^rX~r通过MSE损失监督。最后经模态特异性解码器DaD_aDa​或DrD_rDr​投影回原始数据空间ATAC用sigmoid输出0-1RNA用线性输出。这种分层多尺度设计保留全局结构的同时保持局部细节减少信息损失。三、总结scDAU是一个基于条件扩散特征正则化与多尺度交叉模态翻译网络的单细胞跨模态翻译框架通过模态特异性自编码器降维、三编码器联合零损失实现共享与特异性信号解耦、条件扩散模型约束解耦质量、U-Net多尺度架构实现高保真双向翻译。其核心创新在于以条件扩散作为特征空间正则化机制而非直接生成工具与显式特征解耦协同确保共享表征排除模态特异性噪声以U-Net跳跃连接实现全局结构保留与局部细节精化的平衡。scDAU在四个多组学基准、跨数据集、未见细胞类型和蛋白组学翻译中均优于现有方法并在胶质母细胞瘤数据中保留关键生物学信号为单细胞多组学数据中缺失模态的准确推断提供了通用且可扩展的解决方案。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价