资讯动态

脑电大模型——第八篇:EEGMamba(EEG Mamba)

发布时间:2026/9/8 16:02:29 来源:尧图企业网站定制
论文基本信息Paper:EEGMamba: An EEG foundation model with MambaInstitution:Zhejiang UniversityPublication:Neural NetworksYear:2025Code:Open Source Code1 摘要论文针对现有Transformer类EEG基础模型序列建模二次复杂度高、长序列处理效率低、低标注数据场景下泛化能力不足的问题同时填补状态空间模型SSM在EEG通用表征学习中的应用空白提出EEGMamba——一种基于Mamba的新型EEG基础模型。其核心思想是利用Mamba线性复杂度的长序列建模优势适配EEG信号复杂的时空依赖特性。模型首先对EEG信号进行通道重组与分块掩码通过时频双分支网络提取局部patch特征并引入条件位置编码动态适配不同数据格式随后以双向Mamba2为骨干网络通过前向与后向Mamba块的堆叠交替全面捕获EEG patch间的双向时空依赖关系最终基于patch级掩码EEG重建任务完成自监督预训练。EEGMamba在包含5个数据集、总时长16724小时的大规模多源EEG语料上完成预训练在6类下游BCI任务、6个公开数据集上全面达到SOTA性能且在低标注资源、长序列场景下优势显著验证了基于状态空间模型的EEG基础模型具备极强的表征能力与泛化性。2 背景脑电EEG可无创实时采集大脑电活动是脑机接口BCI与临床神经诊疗的核心技术广泛应用于情绪识别、运动想象分类、睡眠分期、癫痫检测、精神障碍诊断等场景。传统EEG解码方法多为任务专属的监督学习方案依赖人工设计特征受限于标注数据稀缺、跨数据集信号格式差异大通道配置、采样率、时长不一等瓶颈泛化能力普遍较弱。受大语言模型、视觉基础模型的启发EEG基础模型逐渐成为研究热点通过大规模无标注数据自监督预训练学习通用表征再微调适配下游任务。但现有主流方案如BIOT、LaBraM均以Transformer为骨干存在两大核心局限计算效率瓶颈Transformer的自注意力机制具有序列长度的二次复杂度处理长时序EEG数据时计算开销大难以支撑超长序列建模。低资源泛化不足模型微调依赖较多下游标注数据而EEG数据采集与标注成本高小样本场景下性能衰减明显。状态空间模型SSM是一类经典的序列建模方法近年衍生的S4、Mamba等方法实现了线性复杂度的高效长序列建模在NLP、时间序列、视觉等领域展现出媲美Transformer的性能。其中Mamba通过选择性状态空间与硬件感知算法进一步提升了序列建模效率与表达能力。但Mamba在EEG通用表征学习与基础模型中的应用尚未被系统探索其能否适配EEG复杂的时空依赖特性仍待验证。3 贡献本文系统探索了选择性状态空间模型在EEG通用表征学习中的潜力提出了首个基于Mamba的EEG基础模型EEGMamba具体贡献如下基于Mamba的EEG基础模型架构首次将Mamba引入EEG基础模型领域提出EEGMamba架构验证了状态空间模型在EEG时空依赖建模中的有效性为EEG基础模型提供了Transformer之外的全新技术路线。双向Mamba编码器设计针对标准Mamba单向建模的局限提出堆叠式双向Mamba编码器通过交替堆叠前向与后向Mamba2块全面捕获EEG patch间的双向时空依赖结合条件位置编码可自适应不同通道数、不同时长的EEG输入提升跨数据集泛化能力。大规模预训练与全场景验证构建了总时长16724小时的多源EEG预训练语料在6类差异显著的下游BCI任务上完成系统验证所有任务均达到SOTA性能同时在低资源微调、长序列推理、缺失通道鲁棒性等维度上均展现出显著优势为EEG基础模型的性能评估建立了新的基准。4 方法4.1 数据集4.1.1 预训练数据集选取5个格式各异的公开EEG数据集构建预训练语料覆盖临床、认知、睡眠等多种场景确保数据多样性详细信息如下表1 预训练数据集详细信息数据集采样率通道数量总时长样本时长样本数数据集描述TUEG (clean subset)256Hz199246.2h30s1109545天普大学医院临床 EEG 数据库原始数据含大量噪声与坏道经清洗后保留有效子集PhysioNet 2018200Hz67267.4h30s872089睡眠障碍多导睡眠图数据集含 1985 名受试者的睡眠 EEG 记录Raw EEG Data256Hz6442.7h30s5125信息整合与规则分类任务下的 64 通道 EEG 数据Siena Scalp EEG Database256Hz27140.8h30s16901癫痫患者头皮 EEG 数据集含 14 名受试者的长时程记录B-SNIP1 (clean subset)250Hz6026.9h30s3223认知任务 EEG 数据集选取静息态数据并清洗后用于预训练4.1.2 下游数据集选取6类典型BCI任务对应的6个公开数据集验证模型性能覆盖多分类、二分类任务范式且所有数据集与预训练数据来源无重叠具体信息如下表2 下游数据集详细信息任务类型数据集采样率通道数样本时长样本数类别数I. 情绪识别FACED250Hz3210s103329类II. 运动想象分类PhysioNet-MI160Hz644s98374类III. 睡眠分期ISRUC200Hz630s892405类IV. 癫痫检测CHB-MIT256Hz1610s3269932类V. 想象语音分类BCIC2020-3256Hz643s60005类VI. 重度抑郁障碍诊断MODMA250Hz12815s10662类4.2 预处理为统一数据格式、去除噪声伪迹对所有数据执行标准化预处理流程滤波去噪0.3Hz–75Hz带通滤波保留有效脑电频段50Hz或60Hz陷波滤波去除工频干扰重采样所有信号统一重采样至200Hz降低计算复杂度样本切分预训练数据切分为30秒非重叠样本下游数据按对应任务的标准窗口切分幅值归一化以100μV为基准归一化将信号幅值约束在[-1,1]区间内与已有研究设置保持一致。4.3 模型架构EEGMamba整体采用掩码自编码器MAE的自监督预训练框架核心由通道重组与分块掩码模块、时频双分支Patch编码器、条件位置编码、双向Mamba编码器、重建头五部分组成。图1 EEGMamba架构图首先对EEG信号进行通道重组与时间分块随机掩码部分patch随后通过Patch编码器提取每个patch的时频特征并注入动态位置编码接着将patch嵌入展平为序列输入双向Mamba编码器学习全局时空表征最终通过重建头还原被掩码的patch完成自监督预训练。4.3.1 通道重组、分块与掩码策略设原始EEG样本为S o ∈ R C 0 × T S^o \in \mathbb{R}^{C^0 \times T}So∈RC0×T其中C 0 C^0C0为原始通道数T TT为时间点数。通道重组为适配不同通道配置随机选取C CC个通道1 ≤ C ≤ C 0 1 \leq C \leq C^01≤C≤C0并打乱通道维度使模型学习相对空间关系而非绝对通道位置时间分块以固定时间窗口t tt默认1秒对应200个采样点沿时间维度切分得到patch张量X ∈ R C × n × t X \in \mathbb{R}^{C \times n \times t}X∈RC×n×t其中n ⌊ T t ⌋ n\lfloor\frac{T}{t}\rfloorn⌊tT​⌋为单通道patch数量总patch数L C ⋅ n L C \cdot nLC⋅n随机掩码按50%比例随机生成掩码将被掩码的patch替换为全零掩码token得到掩码后的patch集合X ~ \tilde{X}X~。4.3.2 时频双分支Patch编码每个patch分别通过时域、频域两个独立分支提取特征再逐元素相加融合同时兼顾波形的时序演化特征与节律的频域分布特征时域分支由一维卷积层、组归一化层、GELU激活函数与残差连接构成提取时域局部波形特征e i , j t ∈ R d e_{i,j}^t \in \mathbb{R}^dei,jt​∈Rd频域分支先通过快速傅里叶变换FFT提取每个patch的各频段能量向量再经全连接层与残差连接映射到相同维度得到频域特征e i , j f ∈ R d e_{i,j}^f \in \mathbb{R}^dei,jf​∈Rd。最终patch嵌入为两个分支输出之和e i , j e i , j t e i , j f e_{i,j} e_{i,j}^t e_{i,j}^fei,j​ei,jt​ei,jf​4.3.3 条件位置编码CPE为动态适配不同通道数与时间长度的输入采用条件位置编码为patch嵌入注入位置信息设计二维深度卷积层作为位置编码器根据每个patch的时空邻域动态生成位置编码P ∈ R C × n × d P \in \mathbb{R}^{C \times n \times d}P∈RC×n×d无需依赖固定的电极编号与序列长度。将位置编码与patch嵌入逐元素相加得到最终的输入嵌入E p E P E^p E PEpEP4.3.4 双向Mamba编码器骨干针对标准Mamba仅能单向建模、无法全面捕获EEG双向时空依赖的局限提出堆叠式双向Mamba编码器以Mamba2为基础单元交替堆叠前向与后向Mamba块通过残差连接逐层融合特征。将patch嵌入沿时空维度展平为一维序列E 0 ∈ R L × d E_0 \in \mathbb{R}^{L \times d}E0​∈RL×d依次通过K层Mamba块奇数层为前向Mamba捕获前向依赖偶数层为后向Mamba捕获后向依赖每层均加入残差连接E k Mamba k ( E k − 1 ) E k − 1 , k ∈ { 1 , 2 , . . . , K } E_k \text{Mamba}_k(E_{k-1}) E_{k-1}, \quad k \in \{1,2,...,K\}Ek​Mambak​(Ek−1​)Ek−1​,k∈{1,2,...,K}Mamba k { Mamba f , k 为奇数 Mamba b , k 为偶数 \text{Mamba}_{k} \begin{cases} \text{Mamba}^f, k为奇数 \\ \text{Mamba}^b, k为偶数 \end{cases}Mambak​{Mambaf,Mambab,​k为奇数k为偶数​4.3.5 掩码 EEG 重建预训练目标采用patch级掩码EEG重建作为自监督预训练任务使用一个重建头由一个全连接层和一个张量重塑组件组成仅对被掩码的patch计算均方误差MSE损失既降低计算开销又强制模型学习通用的EEG表征L P ∥ X ^ M − X M ∥ 2 \mathcal{L}_P \| \hat{X}^M - X^M \|^2LP​∥X^M−XM∥2其中X ^ M \hat{X}^MX^M为重建头预测的掩码patchX M X^MXM为原始真实掩码patch。4.4 训练与评估硬件环境单台Intel Xeon Gold 6226R CPU 1张NVIDIA RTX A5000 GPU基于Python 3.10.13 PyTorch 2.1.1 CUDA 11.8实现模型配置12层双向Mamba块隐藏状态维度200SSM状态扩展因子64头维度50局部卷积宽度4块扩展因子2预训练设置掩码率50%batch size 32训练40轮采用AdamW优化器初始学习率5e-4权重衰减5e-2余弦退火学习率调度预训练总耗时约5天下游微调设置替换重建头为任务专属MLP分类器训练50 轮batch size 32学习率1e-4二分类任务采用二元交叉熵损失多分类任务采用交叉熵损失评估指标二分类任务采用平衡准确率、AUC-PR、AUROC多分类任务采用平衡准确率、Cohen’s Kappa、加权F1所有结果均报告5次随机种子实验的均值与标准差。5 结果5.1 下游任务整体性能EEGMamba在全部6类下游任务上均达到SOTA性能且参数量仅3.3M优于参数量更大的LaBraM-Base5.8M与BIOT3.2M代表性任务的核心结论如下表3 与现有方法的性能比较情绪识别FACEDCohen’s Kappa达51.34%相比次优模型LaBraM-Base提升4.36个百分点即使从零训练也超过现有基础模型运动想象分类PhysioNet-MICohen’s Kappa达51.31%领先基线模型2个百分点以上睡眠分期ISRUCCohen’s Kappa达74.86%以更小参数量实现更优性能癫痫检测CHB-MITAUROC达89.38%显著超越所有基线方法重度抑郁诊断MODMAAUROC达73.75%相比基线提升明显。整体而言EEGMamba以更小的参数量实现了全面的性能超越验证了Mamba架构在EEG表征学习中的效率与效果优势。5.2 低资源微调性能对比为验证模型在标注数据稀缺场景下的实用价值分别使用10%、30%、50%的下游标注数据进行微调与BIOT、LaBraM-Base对比结果显示表4 与现有基础模型在低资源微调上的性能比较在所有数据比例下EEGMamba均显著优于两个基线模型且数据量越少优势越明显仅使用10%标注数据时EEGMamba在多数任务上的性能已接近基线模型全量微调的水平即使仅30%标注数据EEGMamba的表现仍超过全量数据下的部分基线模型展现出极强的小样本泛化能力。5.3 架构消融实验为验证双向 Mamba 架构的有效性在相同预训练数据下对比不同骨干架构的性能表5 在相同预训练数据集上预训练的不同模型架构的性能比较Transformer 骨干整体性能弱于Mamba系列骨干在情绪识别、抑郁诊断等长序列/复杂模式任务上差距更显著验证了Transformer在EEG长序列建模中的局限单向Mamba单向Mamba1/2性能弱于双向版本证明双向建模对捕获EEG双向时空依赖至关重要双向Mamba1 vs Mamba2双向Mamba2在绝大多数任务上最优得益于Mamba2更大的状态空间维度与更强的表达能力。实验结果充分证明双向设计与Mamba2架构共同贡献了EEGMamba的性能提升架构创新的收益超过了单纯扩大预训练数据量的作用。5.4 Patch编码器消融实验为验证时频双分支编码的有效性对比四种配置原始EEG patch、仅时域分支、仅频域分支、时频融合分支结果显示图2 Patch编码器的消融研究时频融合分支在所有任务上均取得最优性能证明时域与频域特征具有互补性融合后可更全面地表征 EEG 信号仅时域分支优于仅频域分支原因是时域信号本身隐含了部分节律信息而频域特征丢失了时序演化细节原始patch直接输入编码器效果最差说明局部特征提取是提升模型性能的必要环节。5.5 掩码率与Patch重叠分析表6 预训练中Patch重叠的性能比较图3 不同掩码比率下的性能比较Patch重叠影响对比50%重叠与非重叠patch两者性能无显著差异说明非重叠patch即可有效学习表征同时计算效率更高掩码率分析掩码率在0.3~0.7区间均可取得较优性能其中0.5为通用最优值兼顾预训练难度与表征学习质量不同任务可针对性微调。5.6 计算效率对比以CHB-MIT16通道10秒与MODMA128通道15秒为代表对比参数量、FLOPs与推理耗时表7 计算效率对比参数量3.3M与BIOT相当小于LaBraM-BaseFLOPs仅186.1M显著低于BIOT483.3M与LaBraM-Base483.0M长序列场景优势更突出MODMA数据集上EEGMamba单样本推理耗时14.8ms比LaBraM-Base23.0ms快约36%。5.7 缺失通道鲁棒性表8 缺失通道在FACED数据集上的性能在FACED数据集上随机掩码一半通道进行微调实验结果显示模型性能仅下降约3%展现出极强的通道鲁棒性与跨配置泛化能力对临床场景下电极缺失、设备通道不一致等问题有较好的适配性。6 讨论6.1 研究意义EEGMamba首次将Mamba状态空间模型引入EEG基础模型领域验证了线性复杂度的序列模型可有效适配EEG的时空依赖特性突破了Transformer架构的计算效率瓶颈。其在低资源场景、长序列场景下的显著优势为临床EEG分析、便携式BCI设备等数据稀缺、算力受限的场景提供了可行的技术方案也为脑信号基础模型的架构设计提供了全新思路。6.2 局限性单模态局限当前仅基于EEG单模态数据训练未融合眼电、肌电、近红外等其他生理信号多模态互补性未被挖掘实时应用验证不足目前仅在离线数据集上验证性能尚未在实时BCI系统、临床诊疗场景中完成落地验证效率优势未完全释放受EEG patch数量限制Mamba的线性复杂度优势相比NLP、图像领域不够极致超长时序EEG场景的潜力有待进一步挖掘。6.3 未来工作多模态融合拓展引入多模态生理信号探索跨模态对齐的通用脑信号基础模型架构优化与轻量化针对EEG特性进一步优化Mamba结构结合模型压缩技术探索端侧设备部署实时系统落地将模型集成至实时BCI与临床监测系统验证实际应用效果缩放定律探索进一步扩大预训练数据规模与模型参数量系统探索EEG基础模型的性能缩放规律。7 总结EEGMamba是EEG基础模型领域首个基于状态空间模型的代表性工作其核心突破在于跳出了Transformer的技术路径依赖从EEG长时序建模的核心需求出发将Mamba的高效序列建模能力与双向结构、时频编码、动态位置编码等定制化设计结合通过大规模自监督预训练实现了全场景EEG解码性能的全面提升。该工作验证了「状态空间模型可有效适配EEG时空建模」的核心假设为EEG基础模型提供了更高效的架构选择也为后续脑信号大模型的技术演进与落地应用奠定了重要基础。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价