论文基本信息Paper:NeuroLM: A Universal Multi-task Foundation Model for Bridging the Gap between Language and EEG SignalsInstitution:Shanghai Jiao Tong UniversityPublication:International Conference on Learning RepresentationsYear:2024Code:Open Source Code1 摘要论文针对现有EEG预训练模型需针对每个下游任务全量微调、通用性差、计算与存储资源浪费严重的问题提出NeuroLM——首个融合大语言模型能力的EEG多任务基础模型其核心思想是将EEG信号视作一门“外语”接入LLM框架。模型训练分为三个阶段首先通过向量量化时频预测来训练文本对齐的神经分词器将连续EEG信号编码为离散神经token随后冻结VQ编码器将EEG token输入大语言模型通过多通道自回归预训练学习EEG的因果时序信息最终通过多任务指令微调让单模型适配各类下游任务。最大变体NeuroLM-XL拥有17亿参数是目前参数规模最大的EEG信号处理模型之一在约25000小时的大规模EEG语料上完成预训练。在6类差异显著的下游EEG数据集上的实验证明该多任务学习范式具备极强的应用潜力。2 背景脑电EEG作为非侵入式神经信号采集技术凭借高时间分辨率、低成本、便携性优势已成为脑机接口BCI与医疗健康领域的核心工具广泛应用于情绪识别、运动想象、睡眠分期、癫痫检测、疲劳检测等场景。但EEG信号本身存在信噪比低、非平稳性强、采集配置通道数、采样率不统一的问题同时高质量标注数据稀缺导致通用EEG表征提取难度大。现有EEG预训练方法如BIOT、LaBraM虽能通过大规模无监督预训练学习通用表征但仍存在核心局限必须针对每个下游任务单独微调微调后模型仅能执行单一任务逐任务微调消耗大量计算与存储资源复用性差。大语言模型LLM与多模态大模型MLLM的兴起为统一多任务提供了新思路但将LLM迁移至EEG领域面临三大挑战EEG-文本嵌入对齐难缺乏高质量EEG-文本配对数据无法像图文模型那样实现细粒度语义对齐LLM范式下的表征学习难EEG主流预训练为掩码建模如何适配自回归LLM的训练范式尚无成熟方案多任务统一难不同EEG任务的范式、标签、数据格式差异巨大单模型兼顾所有任务且不损失性能难度极高。3 贡献文本对齐的神经分词器嵌入提出基于向量量化时频预测的神经分词器将EEG信号转换为离散编码通过对抗训练与梯度反转层实现EEG与文本的嵌入空间级对齐让EEG token可直接接入现成LLM打通了模态融合的基础。大规模多通道自回归预训练设计适配多通道EEG的自回归预训练策略与阶梯式注意力掩码让模型学习跨通道的因果神经表征基于25000小时大规模EEG数据预训练大幅提升模型跨任务、跨配置的泛化能力。联合多任务微调与推理首次将指令微调引入EEG信号处理领域为不同下游任务设计专属指令模板实现单模型同时执行多种EEG分类任务无需逐任务单独微调显著提升了模型复用效率。4 方法4.1 数据集4.1.1 预训练数据集使用了多个具有不同配置的EEG数据集所有数据集的详细信息见表1数据清洗后的总时间接近25000小时。表1 预训练数据集详细信息数据集通道数量采样率(Hz)总时长(h)数据集描述TUEG17‑23250‑1024~24000由天普大学医院采集得到包含26846份临床脑电记录SEED系列621000170.54数据集包含SEED‑IV15名受试者、SEED‑V20名受试者、SEED‑GER8名受试者、SEED‑FRA8名受试者受试者观看情绪视频诱发对应情绪BCI竞赛IV‑15910008.21运动想象数据集共7名受试者包含左手、右手、足部共2类运动想象任务含空闲状态Emobrain6410244.94多模态情绪数据集共16名受试者采用IAPS情绪图片子集来诱发被试情绪Grasp and Lift3250011.72数据集包含12名受试者完成抓举GAL实验任务Inria BCI5660029.98基于P300信号的拼写数据集共26名受试者运动执行/想象6416047.3运动想象数据集109名志愿者完成2项基线任务、真实肢体运动任务与运动想象任务Raw EEG Data6425634.35在信息整合分类任务、多维规则分类任务采集原始脑电信号静息态数据集642563.0422名受试者完成8分钟静息任务4分钟闭眼、4分钟睁眼Siena头皮脑电数据库3151230.47数据集包含14名患者SPIS静息态数据集6420480.8310名受试者先采集2.5分钟闭眼睁眼静息脑电之后完成105分钟持续响应注意力任务序列固定刺激间隔可变目标vs非目标325121650名受试者完成Brain Invaders视觉P300脑机接口实验采用奇刺激范式使用自适应黎曼几何方法无需校准自采集脑电数据集621000342.23自研混合脑电数据集包含超过140名受试者覆盖多种实验条件4.1.2 下游数据集选取 6 个差异极大的 EEG 数据集验证多任务性能覆盖异常检测、事件分类、情绪识别、睡眠分期、认知负荷检测、慢波事件分类六大典型任务具体信息如下表2 下游数据集详细信息数据集任务类型采样率(Hz)通道数样本数类别数TUAB脑电异常检测256234094552TUEV脑电事件分类256231124916SEED情绪识别100062384753HMC睡眠分期25641372435Workload认知负荷分类50019920882TUSL慢波事件分类2562324534.2 预处理为去除环境与生理伪迹、统一数据格式执行标准预处理流程带通滤波设置0.1Hz-75Hz截止频率保留有效脑电频段陷波滤波根据数据采集地区设置50Hz或60Hz陷波去除工频干扰重采样所有信号统一重采样至200Hz降低计算复杂度幅值归一化将信号值除以100把EEG典型幅值范围-100μV~100μV归一化到[-1,1]区间。4.3 模型架构NeuroLM以GPT-2为基座LLM包含三个规模变体NeuroLM-B2.54亿参数、NeuroLM-L5亿参数、NeuroLM-XL16.96亿参数。整体采用三阶段训练范式4.3.1 文本对齐神经分词器训练为了将EEG纳入到现有的大语言模型中首先需要将EEG信号编码成与文本嵌入空间对齐的嵌入文本对齐神经分词器基本沿用了LaBraM成熟的神经表征器并做了一些改进向量量化的时间频率预测用于训练文本对齐的神经表征器如图1所示。图1 文本对齐神经分词器训练架构图神经分词器由VQ编码器、码本、时域/频域解码器、域分类器四部分组成。分块与编码将多通道EEG切分为不重叠patchpatch大小200对应1秒经时域卷积编码器提取时序特征加入可学习的时空位置嵌入后通过空间Transformer学习通道间关联向量量化将每个patch表征映射到码本中距离最近的离散编码形成离散神经token码本规模为8192×128采用L2归一化后计算余弦相似度匹配时频双域重建同时重建原始时域信号与频域幅值相比单一时域重建能捕捉更丰富的脑电节律特征这与LaBraM回归傅里叶幅值和相位的做法不同因为重构相位对神经表征器训练的贡献很小嵌入空间对齐引入域分类器与梯度反转层通过对抗训练混淆EEG与文本的域分布让EEG token嵌入空间与文本嵌入空间对齐。4.3.2 多通道自回归预训练在将EEG数据传递到大语言模型之前通过冻结的VQ编码器将输入的EEG数据编码到与文本空间对齐的EEG token中之后加载预训练的大语言模型并利用学习到的EEG码本扩充文本词汇。EEG token添加了从LLM中复用的时间嵌入和新的空间嵌入如图2所示NeuroLM通过多通道自回归进行训练即根据可见的EEG token预测下一个EEG token以使模型具有学习特殊模式的脑电因果关系的能力。图2 NeuroLM训练示意图冻结VQ编码器将EEG转换为对齐文本空间的离散token扩展LLM词表容纳EEG码本。多通道自回归策略不同于文本逐token预测EEG为多通道并行结构因此每个时间步同时预测所有通道的下一个token阶梯式注意力掩码设计特殊掩码让每个token可观测当前及之前所有时间步的全部通道信息适配EEG的多通道时空结构训练中每轮迭代混入少量文本数据保留LLM原生的语言建模能力。4.3.3 多任务指令微调在这一阶段目标是利用LLMs的力量将不同的下游数据集作为一个整体进行整合引入指令调优来处理各种下游任务如图2所示为每个下游任务设计专属指令模板用[SEP]特殊token拼接EEG token与文本指令实现模态切换。指令分为问答式与多选式两类具体指令见表3损失仅计算文本答案部分不计算EEG与问题部分稳定训练过程所有下游任务联合训练单模型同时学习全部任务。表3 下游数据集的指令设计数据集指令描述TUAB[SEP] Question: Is this EEG segment abnormal? Answer: {Yes, No} [END]TUEV[SEP] Question: Which event type does this EEG segment belong to? Options: (A AA) spike and slow wave. (B BB) generalized periodic epileptiform discharge. (C CC) periodic lateralized epileptiform discharge. (D DD) eye movement. (E EE) artifact. (F FF) background. Answer: {(A AA), (B BB), (C CC), (D DD), (E EE), (F FF)} [END]SEED[SEP] Question: Which emotion type does this EEG segment belong to? Answer: {Positive, Neutral, Negative} [END]HMC[SEP] Question: Which sleep type does this EEG segment belong to? Options: (A AA) Wake. (B BB) NREM‑1. (C CC) NREM‑2. (D DD) NREM‑3. (E EE) REM. Answer: {(A AA), (B BB), (C CC), (D DD), (E EE)} [END]Workload[SEP] Question: Is this EEG segment of high workload? Answer: {Yes, No} [END]TUSL[SEP] Question: Which type does this EEG segment belong to? Options: (A AA) background. (B BB) seizure. (C CC) slowing. Answer: {(A AA), (B BB), (C CC)} [END]4.4 训练与评估硬件环境8张NVIDIA A100-80G GPU基于Python 3.11.8PyTorch 2.2.2CUDA 12.1实现分词器训练共50轮AdamW优化器余弦学习率调度峰值学习率5e-5自回归预训练共20轮峰值学习率6e-4权重衰减0.1梯度裁剪阈值为1指令微调Base/L版本训练5轮XL版本训练3轮大模型采用更低学习率避免过拟合评估方式测试时取logits最大值作为预测结果不使用束搜索采用平衡准确率、AUC-PR、AUROC、Cohen’s Kappa、加权F1等指标报告3次随机种子实验的均值与标准差。5 结果5.1 多任务整体性能表4表5和表6展示了所有的结果下划线值代表单任务方法的最佳结果而加粗值代表NeuroLM的最佳结果。表4 TUAB和TUEV上的结果表5 SEED和HMC上的结果表6 Workload和TUSL上的结果NeuroLM作为多任务统一模型性能与多数单任务基线方法相当虽略低于单任务SOTA模型LaBraM但实现了“单模型执行多任务”的范式突破。模型规模从B提升至XL时多数下游任务性能持续提升验证了大参数对EEG表征学习的增益在极小样本数据集TUSL上模型性能显得不是很稳定不同任务数据量不均衡会带来挑战大数据集与小数据集达到最优性能的训练步长不一致小样本任务易出现过拟合与性能波动。5.2 鲁棒性消融为了验证NeuroLM的鲁棒性在多任务指令调优阶段枚举了选项的顺序并从所有可能的组合中随机选择一个。图3说明了是否对选项进行洗牌的结果。图3 指令选项是否洗牌的消融研究在TUEV和HMC上与没有洗牌的NeuroLM相比有洗牌的NeuroLM获得了相当的性能洗牌操作似乎显著降低了TUSL的性能这一现象归因于TUSL的数据不足因为与其他两个数据集相比TUSL的数据样本数量要少得多。预计如果给予更多的数据NeuroLM也会取得类似的结果总的来说NeuroLM对任意顺序的选项具有良好的鲁棒性这表明NeuroLM在预测时确实理解了问题的语言含义。5.3 指令数据量的消融使用TUABTUEV和HMC数据集来扩展指令数据规模并验证NeuroLM和其他基线方法的性能结果如图6所示。图4 不同方法在不同指令数据比例下的比较结果表明NeuroLM在所有条件下都表现出相似的性能对于TUABNeuroLM、LaBraM和CNN-Transformer表现出稳定的性能对于TUEV和HMC只有NeuroLM和LaBraM相对不受数据量变化的影响。这些发现表明NeuroLM具有鲁棒性即使在不同的指令数据规模下也能保持较高的性能突出了其在多任务学习场景中的有效性。5.4 多通道自回归可视化曲线图5展示了NeuroLM的预训练损失、准确率和验证困惑度。图5 多通道自回归预训练的训练和验证可视化随着训练的进行损失稳定收敛验证困惑度降低这意味着NeuroLM可以很好地泛化到未见过的EEG数据参数较多的大模型会获得较小的损失和困惑度NeuroLM-L取得了与NeuroLM-XL相似的验证困惑度表明当前的预训练数据规模仍无法满足亿级别参数的训练。5.5 多通道自回归预训练的消融多通道自回归预训练旨在通过预测每个通道的下一个EEG token来模拟当前的因果LLM图6展示了多通道自回归预训练对NeuroLM的消融研究。当使用多通道自回归预训练对NeuroLM进行预训练时表现出显著的性能提升强调了多通道自回归预训练的有效性。图6 多通道自回归预训练的消融研究5.6 时间-频率预测的消融时域和频域是EEG信号的两个重要方面。为了研究这两个域对于不同下游任务的重要性通过将神经分词器训练中的重建目标设置为仅时域、仅频域和同时时域和频域原始NeuroLM来研究三种变体。图7给出了三种变体之间的对比发现时域在TUAB、Workload和TUSL上起着更为重要的作用。相反重构频率成分在TUEV、SEED和HMC上获得了更好的性能表明频域对于事件分类、情绪识别和睡眠阶段分类具有重要意义。图7 神经分词器中时域或频域重构的消融研究5.7 EEG和文本嵌入的可视化为了评估EEG-文本嵌入空间对齐的有效性使用t-SNE对嵌入进行可视化结果如图8所示左半图为不对齐训练神经分词器右半图用对齐法训练神经分词器。EEG嵌入扩展到文本空间之外而没有对齐的情况下模型无法预测在多任务指令调优中我们期望的答案即模型会输出随机单词而不是选项中的(A AA)(B BB)或(C CC)等选项从而导致下游任务在大多数指标上的得分接近零。这种结果似乎源于注意力评分的混乱因为EEG和文本嵌入保持在不同的空间。在对齐训练时EEG空间大多与文本空间对齐导致指令调优中正常预测证明了EEG-文本对齐的必要性。图8 EEG和文本的t-SNE可视化表示5.8 不同预训练轮次的消融对不同轮次的预训练模型进行了消融研究以证明最佳的预训练轮次。如表7、表8、表9所示使用了5、10、15和20个轮次的预训练模型加粗表示最佳结果下划线表示次佳结果。表7 TUAB和TUEV上的结果表8 SEED和HMC上的结果表9 Workload和TUSL上的结果大多数数据集上20轮的预训练获得了最好的结果在SEED和HMC上5个迭代次数的模型性能最好在Workload上10个迭代次数的模型性能最好总体而言更多轮次的预训练可以在不同的任务中获得良好的性能。6 讨论6.1 局限性NeuroLM首次尝试将各种EEG下游任务整合到一个统一的模型中并在多个下游数据集上取得了有希望的结果。然而它也存在一些局限性单任务精度仍有差距相比针对单数据集端到端微调的SOTA方法多任务统一模型的单任务性能仍存在一定差距。超参数敏感性较强模型效果对学习率、训练轮次、数据配比等超参数较为敏感需精心调参才能获得最优结果。对齐粒度较粗受限于高质量EEG-文本配对数据的缺失目前仅实现空间级粗粒度对齐难以支持细粒度语义理解与生成类任务。数据不均衡挑战不同下游任务数据量差异可达上千倍小样本任务易过拟合多任务联合训练的权重分配仍有优化空间。6.2 未来工作升级基座LLM替换为LLaMA 3等更先进的开源大语言模型进一步提升多任务学习与推理能力。引入混合专家架构针对EEG与语言的模态差异设计模态专属专家模块提升多模态融合效率。细粒度语义对齐构建EEG-文本描述配对数据集在分词器阶段引入对比学习损失实现更细粒度的语义对齐。拓展任务与数据边界纳入更多类型的EEG任务与更大规模预训练数据探索零样本、少样本下的新任务泛化能力。7 总结NeuroLM是首个将指令微调引入EEG信号处理领域的多任务基础模型开创性地提出“将EEG视作外语接入LLM”的技术路线通过文本对齐神经分词器、多通道自回归预训练、多任务指令微调三阶段训练实现了单模型同时执行多种EEG任务的突破。该工作打破了传统EEG模型“一任务一微调”的范式验证了大语言模型范式在脑电信号处理中的可行性与巨大潜力为通用脑电大模型的发展提供了全新思路也为后续更高效的脑机接口与医疗健康应用奠定了基础。