BraVista:多模态大语言模型可学会读取脑信号,实现统一多任务 EEG 解码
Multimodal LLMs Can Learn to Read Brain Signals: A Vision--Language Model for Unified Multi-Task EEG Decoding
BraVista 视觉-语言框架将多通道 EEG 编码为结构化图像并输入通用域 VLM,在睡眠分期、情绪识别、认知负荷分类和异常 EEG 检测四个任务上表现良好。该方法无需大规模 EEG 专用预训练,EEG 到图像的表示方式对性能至关重要。受控扰动实验显示,模型随噪声增加而性能逐步下降,提示其依赖的是 EEG 相关信号而非表面视觉模式。
脑电解码长期受制于低信噪比、信号非平稳与漫长的校准过程[1]。深度学习虽已进入这一领域,但模型大多按单一范式定制,一个架构能否统一不同的BCI范式始终存疑,EEGNet的设计初衷正是围绕这个问题展开[2]。为改善泛化,自监督路线尝试以信号变换构造前置任务,降低情绪分类对全监督标注的依赖[3],或先把多通道一维脑电转成二维脑图谱,再用对比预测编码学习运动想象表征[4];多任务协作学习则通过同时学习多个任务来缓解过拟合并增强泛化[5],多任务学习本身也被视为EEG信号分类中值得探索的方向[1]。但如何让神经信号与基础模型有效对接、进而跨数据集做多任务学习,仍是悬而未决的开放问题。
BraVista给出了一种回答:把多通道脑电编码为结构化图像,再由指令条件化的视觉-语言模型承载多任务学习。它不从零训练脑电专用大模型,而是对通用领域VLM做继续后训练,借用其视觉与语言先验来适配神经信号,从而省去单独的大规模脑电预训练阶段。在覆盖睡眠分期、情绪识别、认知负荷分类与异常脑电检测的四个数据集上,模型均表现出强劲性能,而脑电到图像的具体表征方式被证明对性能至关重要。
这一设计与此前把脑电转二维图谱仅作为单一任务表征学习流程一环的做法[4]形成对照:结构化图像在这里本身就是神经信号与通用基础模型之间的接口;EEGNet之问[2]也由此获得新的可能——一套指令驱动的模型即可覆盖四类异质任务。扰动实验进一步表明,随着噪声递增,性能渐进退化,提示模型依赖的是脑电相关信息而非表层视觉纹理,回应了“转图像”路线天然面临的“只看图、不看信号”的质疑。
当然,这仍是未经同行评议的预印本,摘要也未报告具体数值或与各任务专用模型的系统比较。论文自陈的跨任务、跨被试与跨记录条件泛化难题,是否已被四个任务上的表现真正覆盖,仍有待后续工作检验。
- 1.Riemannian Approaches in Brain-Computer Interfaces: A Review · IEEE Trans Neural Syst Rehabil Eng 2017
- 2.EEGNet: a compact convolutional neural network for EEG-based brain-computer interfaces · J Neural Eng 2018
- 3.Self-Supervised EEG Emotion Recognition Models Based on CNN · IEEE Trans Neural Syst Rehabil Eng 2023
- 4.Self-Supervised EEG Representation Learning with Contrastive Predictive Coding for Post-Stroke Patients · Int J Neural Syst 2023
- 5.Multi-Task Collaborative Network: Bridge the Supervised and Self-Supervised Learning for EEG Classification in RSVP Tasks · IEEE Trans Neural Syst Rehabil Eng 2024
来源:AI × 生物医药 · arxiv.org