资讯动态

生物医学基础模型强在哪里?我们真的知道它学到了什么吗

发布时间:2026/10/8 17:29:31 来源:尧图企业网站定制
生物医学基础模型越来越强刷榜速度一个季度比一个季度快。组会里最常听到的一句话是这个模型又SOTA了但紧接着的问题往往是它到底抓住了什么生物学信号是真实学到了调控机制还是只记住了数据里的批次效应和实验伪影这个话题我关注了很久也踩过不少归因工具的坑。这篇文章想把模型很强 vs 我们不懂它这条裂缝拆开讲清楚基础模型在蛋白质、基因组、单细胞、医学影像四个方向到底能做什么所谓学到在技术层面意味着什么事后归因工具为什么经常给假答案以及抛开打开黑盒的执念还有哪些更务实、更能落地的验证路线。适合AI for Science方向的研究者、临床算法团队的工程师以及所有对模型可靠性有要求的读者。1. 基础模型在生物医学的势力范围从序列到表型的四张地图1.1 四种模态、四类模型各自的强不是一个概念生物医学基础模型不是单指某一个模型而是散落在四个模态里的大家族它们的输入输出完全不同能力边界也完全不一样。先把地图展开后面讨论模型学到了什么才有共同语境。第一类是蛋白质语言模型代表是ESM系列和ProtTrans。这类模型把氨基酸序列当作句子去训练用掩码语言模型目标学习进化上的共变模式。ESMFold之后单序列直接预测结构成为可能这在以前需要多序列比对和巨大的搜索成本。蛋白质模型的强体现在结构预测精度和功能注释的泛化能力上——它抓到了序列进化中隐含的物理约束。第二类是基因组DNA模型比如DNABERT、Nucleotide Transformer。它们把基因组当作超长文本用tokenizer切k-mer在全基因组尺度上预训练。这类模型的强项是学习调控语法启动子、增强子、剪接位点、保守元件之间的关系。Enformer虽然不完全算基础模型但它的注意力机制已经把远端调控相互作用这类问题变成了可计算问题。第三类是单细胞转录组模型Geneformer、scGPT、scFoundation是主力。输入是单细胞RNA-seq的表达谱模型学习的是细胞状态、细胞类型和基因调控网络的表征。它们的强体现在zero-shot的细胞类型注释、批次整合和扰动响应预测——一个在数千万细胞上预训练的模型拿到新数据集不需要重新训练就能给出合理的细胞标签。第四类是医学影像基础模型包括病理切片、CT、MRI的自监督预训练模型。它们不依赖大量人工标注通过对比学习或掩码重建从影像本身学表征。这类模型的强在于迁移效率预训练后用少量标注就能达到以前需要上万张标注图像才能实现的诊断精度。这四类模型的共同点是用大规模预训练替代手工特征工程差异点是数据模态、预训练目标和下游任务的性质。讨论它学会了什么必须先区分是哪一种模型——因为蛋白质模型学的是进化约束影像模型学的是纹理和形态单细胞模型学的是表达共变它们的内部表征结构和解释方法完全不同。1.2 强是诱惑也是误导信号我做过一个粗略对比实验在一个基因表达分类任务上传统方法先做差异表达基因筛选再用随机森林和微调后的单细胞基础模型在训练集上表现接近但到了另一个平台的测序数据上基础模型掉了近20个点——不是因为它笨是因为它把第一个平台特有的批次特征当成了判别信号。这件事给我留下的印象很深基础模型在下游任务上表现好不等于它找到了可迁移的生物学规律。刷榜指标有一种特殊的催眠效果。当模型的AUPR从0.85涨到0.92人很容易默认智能在增加默认它学到了更深的东西。但指标只能说明模型在某个数据分布上拟合得好不能说明拟合的是机制还是伪影。真正需要警惕的是基础模型规模变大、任务变多但学到了什么这个问题始终悬而未决而且规模越大这个问题越难回答。2. 模型记住的是真正的生物学还是数据里的捷径2.1 捷径学习shortcut learning在医学数据里的触目惊心案例先说两个不是我做的但影响我很深的经典案例。第一个是皮肤癌分类模型研究者发现模型不是在看痣的形态而是在看图片里的标尺和皮肤周围的颜色——有标尺的图片更可能是恶性因为临床拍摄恶性病灶时常放标尺作参照。模型抓住的是拍照流程的特征不是疾病本身。第二个是胸部X光片模型模型学会利用医院ID来判断疾病因为某些医院的病人群体和拍摄设备有系统性差异同一家医院的片子会带上它的设备指纹。这两个案例都是影像领域但生物医学序列模型同样中招。病理切片模型被报道出利用染色伪影做判断不同实验室的染色方案不同模型只要识别颜色风格就能分类根本不需要看细胞形态。在单细胞数据上批次效应batch effect是最常见的捷径——不同测序平台、不同实验批次的表达谱存在系统性偏移模型学会了拿这个偏移当信号。你以为是基因表达差异驱动分类实际是哪个实验室做的实验驱动了分类。这类问题的共同特征训练集和测试集来自同一分布模型表现优异换一个采集环境性能立刻崩掉。而且越大的模型越容易记住这些捷径因为它有足够的容量去拟合所有便捷信号。2.2 表征空间里的统计关联金字塔那基础模型到底学着什么我的理解是它在构建一个多层的统计关联结构从序列特征到功能属性的映射本质上是压缩了海量数据的联合分布。以DNA模型为例它预测某个变异位点是否影响基因表达时可能是在利用连锁不平衡——即相邻位点的共遗传模式。这种情况下模型内部确实存在位点A与位点B相关的表征但这不是位点A调控基因C的机制知识。模型能给出正确预测但给出的理由是统计性的这个位点与附近已知的调控变异高度连锁所以它看起来相关。预测正确因果解释错误两者并存。想要检验模型是不是在用捷径最直接的办法是做一个可控的交叉验证在模型训练时剔除所有可能泄漏信号的源数据看看它在真正独立的数据上还能不能打。另一个办法是扰动测试人为改变某个潜在的伪影如批次标签、图像背景、染色风格看模型输出会不会大幅波动。如果在输入生物学信号不变的情况下仅仅改变伪影就导致预测翻盘那基本可以判定模型走的是捷径。2.3 探针测试为什么在这里是双刃剑探针测试probing是回答模型学到了什么的常用工具在模型中间层表征上训练一个线性分类器看它能否区分细胞类型、结构域或其他生物学概念。如果分类器准确率高就说模型的表征编码了这些概念。听上去很美但要小心线性探针的乐观偏差。模型表征是高维的线性分类器有极大的自由度去利用维度间的微弱统计差异。一个在随机初始化的模型上训练线性探针有时都能得到高于随机的准确率因为高维空间里总能找到一条线性分割路径。更关键的是探针只能说明信息可以被提取不能说明模型在前向传播中主动使用这些信息。模型可能有编码细胞类型的潜在表征但实际分类用的是截然不同的特征。最稳妥的探针实践是加控制任务control task设计一个语义上不应该被编码的属性比如基因名称的字母数、样本编号的奇偶性看探针能不能提取。如果控制任务上探针也能达到相似准确率说明模型表征里存在大量表层统计特征之前探测到的生物学概念需要重新评估。3. 事后归因的三大陷阱看了解释反而更困惑3.1 注意力权重不是解释最多算线索注意力权重可视化是现在最流行的解释手段。热力图一画注意力高的区域看起来就是模型关注的位置似乎很直观。但注意力是不是等于重要性这个问题在NLP领域早就吵过一轮了。我做一个简单的实验微调一个基因语言模型做启动子预测画出注意力权重看起来高亮区集中在转录因子结合基序附近。然后我做对抗性扰动——把注意力权重强行重新分配把高注意力区域换成低注意力区域但保持其他计算路径不变模型的预测几乎不受影响。这说明什么说明模型的实际决策不依赖被可视化的那部分注意力。注意力权重是模型处理序列时的中间产物它能反映计算过程的一部分流向但不能作为模型按照这个逻辑做判断的证据。把注意力热力图当作解释呈现给评审或临床医生会制造一种我们理解了模型的错觉实际上我们只是看到了模型的注意力动态而不是决策原因。3.2 梯度类归因的不稳定性与饱和假象梯度类方法Saliency Map、Integrated Gradients、SHAP类近似是另一大解释工具流。这类方法的逻辑是对输入求梯度梯度大的位置对输出影响大。但梯度有个著名的饱和问题当输入特征对预测的贡献达到一定强度后梯度会趋向于零。一个典型的基因区域可能对模型输出有强驱动作用但因为信号已经足够强梯度反而很小。这会导致归因图漏掉最重要的输入。在序列模型上我还遇到过归因不稳定对同一个样本微调不同的随机种子得到的归因图谱差异很大有些重要位点甚至在两次运行中从峰顶变为零值。原因是模型在训练中形成了多个等价的内部路径梯度选择的路径取决于初始化和随机性。用积分梯度Integrated Gradients比纯梯度稳定但依然不能解决多路径等价问题。归因图反映的是模型在某条计算路径上的敏感性不是模型内在逻辑的唯一答案。3.3 探针和扰动都是验尸报告不是测谎仪我一直觉得事后归因工具本质上是验尸报告——它在模型完成推理之后尝试从输出或激活状态反推决策过程。验尸报告能告诉我们死因线索但测谎仪要的是模型自己说出来的真实决策依据目前还没有可靠的测谎仪。扰动实验perturbation是另一种思路删掉某个输入token、突变某个核苷酸观察模型输出变化。这类方法有直观的因果意味但也面临组合爆炸问题——单个位点的扰动效应不等于它在真实序列中的贡献因为位点之间有交互作用。一个位点单独删掉影响很小但和另一个位点一起删掉影响巨大基于单点扰动的归因会系统性低估交互信息。更麻烦的是扰动方式本身是人为设定的模型对删掉一个token这种从未见过的输入会产生异常反应这时候观察到的输出变化反映的是模型对分布外输入的脆弱性而非正常的决策逻辑。简单地说事后归因工具的可靠程度低于大多数人的预期。它们适合用来产生假设不适合用来证明模型学到了什么。4. 对话走到临床与制药环节黑盒问题就从学术缺憾变成安全底线4.1 分布偏移之下SOTA模型不堪一击实验室里的基准测试永远是同分布或近似分布的验证集真实世界的医学数据却充满分布偏移。我在多中心数据上验证过一个诊断模型的泛化情况在中心A训练的模型在中心B的数据上准确率下降幅度远大于传统特征工程模型。原因就是中心A和中心B的扫描设备、患者群体、图像采集协议都不同模型在中心A学到的纹理特征在中心B的影像上无法复用。类似案例也出现在药物研发场景。用基础模型预测药物对特定细胞系的疗效训练数据里实验批次信息若未充分控制模型会在同批次验证集上表现正常换一批次立刻失去预测力。药品研发流程中一个基于错误预测的靶点决策浪费的不只是算力还有实验验证的时间与经费而在医学诊断里一个错误的置信度直接关联患者的治疗方案。4.2 谁为不可解释的决策承担责任医学决策链条里有一个不能被绕过的环节责任归因。一个模型输出建议使用该药物方案如果模型内部不可解释出了问题谁负责算法工程师部署医院模型供应商没有清晰的归因链路整个部署就会卡在合规审查。这不是过度谨慎。监管机构已经明确要求高风险AI系统需要提供决策依据纯黑盒模型在这个框架下很难通过审计。很多团队试图用事后的归因图去满足监管要求但正如前面所述这类工具生成的解释不具备可验证的稳定性。拿一个对抗扰动就翻转的注意力热力图去解释临床决策审计人员一眼就能看出问题。模型在生物医学里的定位应当是假设生成器而不是真理审判官。它可以快速筛选候选靶点、指出需要重点关注的基因区域、生成可检验的科学假设但每个假设必须回到湿实验或独立队列中得到验证。把基础模型的输出当作最终结论直接进入临床路径错误的方式不是模型不够准而是用错了链条上的环节。5. 不看黑盒内部转向可验证的外部边界5.1 干预闭环模型的预测必须回到真实实验对账与其执着于理解模型内部的每一个参数不如把验证的焦点放到输出上模型的预测能不能通过独立的真实实验验证。以基因调控预测模型为例模型给出一个候选增强子区域的评分那就用CRISPR扰动实验去敲掉这段区域检测目标基因表达是否改变。如果实验验证率显著高于无模型基线说明这个模型的输出具有可预测的生物学价值。我不需要知道模型内部怎么表征增强子我只需要确认它在真实世界里有可靠的预测效力。干预闭环的另一个好处是它能暴露捷径。如果模型预测的增强子区域在独立实验里大量验证失败而模型在基准测试上依然高分说明它的高正确率来自数据集自身的泄漏信号——大概率是训练集和验证集的构造方式有问题。真实实验是对抗自我欺骗的最可靠的工具。5.2 不确定性量化让模型自己承认它不知道部署生物医学基础模型时比预测准不准更重要的其实是它有没有正确表达自己不知道。临床上最危险的不是模型犯错而是模型犯错时给出高置信度。实操上可以做三件事。第一深度集成Deep Ensembles训练多个不同初始化的模型用它们的预测方差估计不确定性方差大的样本自动标记为低置信度。第二MC Dropout推理时保持Dropout开启多次前向传播得到预测分布衡量预测离散度。第三共形预测Conformal Prediction在验证集上校准出保证覆盖率的分位区间使模型输出带统计保证的区间。这些方法都不需要打开黑盒却能为黑盒输出装上可靠性的保险丝。我建议每个生物医学模型的部署流程都加入一个简单的规则当预测方差高于预设阈值时不输出结论转交人工处理。这比对模型的每个决策都强行找一个解释要安全得多。5.3 从追模型想什么到管模型能做什么回到标题的问题我们真的知道它学会了什么吗我的答案从最初的理论担忧变成了实践上的实用主义。模型学到的内容本质上是高维数据的压缩人类认知无法容纳这种高维压缩的具体形态我们只能通过外部验证间接了解它。实操路线其实是清晰的每个基础模型发布时先做分布内指标和分布外指标的对比测试观察性能随环境变化有多剧烈再做控制任务探针检验表征里是否混入大量表层伪影最后在真实闭环中验证输出有效性。这三个步骤执行到位即使模型内部仍然是一个黑盒我们已经把它的行为边界和可靠性约束到位。如果一个模型能给出可验证的生物学发现在跨中心数据上保持稳定并能诚实地表达自身不确定性我不需要虚假地声称我知道它学会了什么因为它的价值已经在真实世界里被证明了。追问它内部到底编码了什么规律可以作为科学探索的方向但不能成为部署和使用的必要条件。毕竟医生治疗病人时依据的是经过验证的疗效证据而不是药物的每个有效成分在体内遵循的每一条化学反应路径的完整细节。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑