
1. 为什么要把起始反应和持续反应分开1.1 言语信号天生就有“突变”和“保持”两副面孔一段言语很难用单一的时间尺度来概括。拿一个自然句子举例句首辅音从无声到有声的爆发会在几十毫秒内产生剧烈的声学跳变而后续音节、词汇和语调则要拖出几百毫秒甚至更长的相对稳定段。听觉系统对这两种时间尺度的处理方式并不一样起始响应对声压包络的一阶变化非常敏感更像是“新事件检测器”持续反应则更像一个状态维持器通过皮层内循环和反馈把语音特征保持在加工缓冲里。人类颞上回superior temporal gyrus, STG并不是一块均质的听觉皮层不同亚区对瞬态和持续信号的权重差异很大。如果项目目标是把颞上回的反应摸清楚第一件事就是别把两种反应揉在一个窗口里。1.2 空间图谱的作用回答“哪里先响应、哪里持续响应”STG沿着前后轴有明显的功能梯度。靠近Heschl回的后部区域接收更多来自初级听觉皮层的上行输入对频谱时间和包络瞬态更敏感再往前的中前部区域与额下回和颞中回存在更长距离的连接更多参与音位表征、词汇语义和句法整合。一个简单的激活图会把这两类处理叠在一起像把红色和蓝色混成紫色最后只能得到“这个区域有反应”信息损失非常大。空间图谱要做的是把时间维度作为显式变量在每个皮层顶点或体素上分别估计起始成分和持续成分然后输出一张带分离信息的图。这样一来观察结果就不再是“STG激活了”而是“起始反应峰值偏向后部、持续反应峰值偏向前部”这种有结构的问题。1.3 不分开的代价平均激活图会抹掉一切差异用一个简单例子说明。假设皮层表面有两个相邻体素A在刺激开始后的前300毫秒有一个很强的瞬态峰之后几乎无反应B在起始阶段没有明显反应但在随后2秒的持续语音里信号平稳抬升。如果按传统boxcar把整个刺激窗口当一个回归量两个体素很可能都得到中等大小的beta值组平均图看起来又光滑又均匀实际上两种完全不同的反应模式全部被抹平。反过来只要在模型里分别估计起始和持续两个成分再把两者比值做成一张图谱A和B立刻会被区分开。这里没有使用更复杂的算法只是在设计矩阵上多拆了一个回归量就多出一整维空间信息。我这里的“起始反应”指锁时到刺激开始的事件相关反应持续反应指刺激窗口内的稳态平台它既不包括刺激结束之后的offset响应也不包括任务准备期的“预期效应”。这个术语边界如果不先定清楚后面跟合作的临床医生或工程师沟通时很容易鸡同鸭讲。2. 构建空间图谱的完整管线从刺激序列到统计参数图2.1 实验设计原则让两种成分都有干净的估计窗口要做起始和持续成分分离实验设计需要提前让步调。最核心的原则有三条第一刺激时长必须长短不一第二刺激间隔必须抖动第三每个条件下的事件数量不能太少。以fMRI为例如果所有语音刺激都是固定2秒起始事件和持续窗口在时间上就会高度共线。只要刺激清单里有0.35秒的单音节、1.2秒的短语、2.5秒的完整句起始回归量和持续回归量就具备不同的时间形态统计模型才有可能把它们拆开。刺激间隔建议做2到6秒的均匀抖动避免大脑进入规律的“节奏锁定”状态。另一个很实际的原因是fMRI的TR通常是1.5到2秒如果所有刺激起始都落在同一个TR相位上整个设计矩阵在时间采样上会退化再优秀的反卷积算法也救不回来。事件数量方面每个run至少要有40个以上可用的起始事件持续事件则按不同时长均匀分布。我一般会多放15%的事件因为预处理后总会丢掉一些头部运动过大的片段。如果是MEG/EEG起始事件可以更多因为采集本身是毫秒级、无TR限制但也要注意不要让相邻刺激间隔太短否则TRF的时间窗口会被截断。2.2 预处理的关键参数不是越平滑越好看很多团队对听觉语言fMRI的处理默认用6到8毫米FWHM高斯平滑但目标是做颞上回内部的前后梯度这个平滑尺度偏大。我实测下来4毫米FWHM或更低能保留更多STG前部和后部之间的空间差异8毫米平滑会把两个方向的峰值直接糊成一个团。排序时最好把多尺度平滑的结果都生成一版用并排视图检查峰值的位置稳定性。另一个关键点是配准方式。颞上回的解剖结构个体间差异很大尤其在颞平面和颞上沟区域。直接在MNI体素空间做组平均会在投影时引入不少位置偏差。建议用基于皮层表面的配准流程比如FreeSurfer的surface pipeline或HCP工作流先把每个被试的STG铺到公共膨胀球面上再做顶点级别的组分析。这个方法比体素归一化多花不到半天时间但得到的空间图谱在个体对齐质量上会好很多。生理噪声处理也不能省。颞叶靠近脑膜和颅底血管心跳噪声和呼吸波动都很明显有时会伪装成颞上回的持续激活。我会在预处理时加入aCompCor把白质、脑脊液的高方差成分作为回归量有足够采样率时再加RETROICOR的心跳呼吸相位回归能明显降低皮层表面边缘处的伪峰。2.3 设计矩阵起始用零时长事件持续用完整窗口设计矩阵这一步我直接给出一个可以跑的模板。假设你在用Nilearn或SPM逻辑都一样同一段语音刺激同时录入两个trial_type一个是duration0的起始事件另一个是duration实际刺激时长的持续事件。import numpy as np from nilearn.glm.first_level import make_first_level_design_matrix t_frames np.arange(0, 300, 2.0) # 300秒扫描TR2秒 events [ # 起始事件锁时到语音开始持续时间为0 {onset: 10.0, duration: 0, trial_type: onset}, {onset: 22.5, duration: 0, trial_type: onset}, # 持续事件同样锁时到语音开始duration为刺激实际长度 {onset: 10.0, duration: 1.2, trial_type: sustained}, {onset: 22.5, duration: 2.5, trial_type: sustained}, ] dm make_first_level_design_matrix( t_framest_frames, eventsevents, hrf_modelglover, drift_modelcosine, high_pass0.01, )为什么要把同一段语音拆成两个回归量因为onset和sustained两个时间窗口的形态不同起始回归量是一个很窄的尖峰持续回归量是一条很宽的箱型。经过HRF卷积后两者在时间序列上仍然是可分辨的前提是刺激间隔有抖动、时长有变化。如果你担心duration0导致软件内部的离散化出现问题可以设成0.01到0.05秒效果等同。这里有一个容易踩的坑有人为了“把持续反应估计得更干净”只放一个持续回归量然后把所有未解释的瞬态当噪声。结果就是持续图谱里混入了大量起始驱动信号。反过来有的设计把所有刺激当成瞬时事件得到的是清一色的起始导向图谱持续成分完全丢失。两个回归量缺一个所谓空间图谱就有了系统性偏置。2.4 从beta图到空间图谱组平均、表面投影和差异图一级分析跑完之后每个被试会得到两个beta图一个对应起始成分一个对应持续成分。在组分析之前我会先对每个被试做一级对比也就是“onset sustained”和“sustained onset”两个对比这样能在个体层面先确认图谱结构。组分析建议使用混合效应模型。如果条件允许基于表面做顶点级别的组平均和z变换然后叠加在标准膨胀面上。可视化时常用做法是把“起始主导区”用一个颜色映射比如暖色“持续主导区”用另一个颜色映射比如冷色两张图叠加在同一张皮层表面上中间用白色过渡看起来非常直观也方便在报告里解释空间分离。如果团队里没有surface pipeline也可以用MNI体素版本但我会额外做一步把每个被试的STG用一个解剖mask裁出来只在这个mask内做组分析避免额叶或顶叶的强激活干扰色阶。另一个常用表示是“概率图谱”统计每个顶点有多少比例的被试属于起始主导、多少比例属于持续主导。概率图谱对临床研究尤其友好因为它保留了被试间变异的可视化信息而不只是组平均的一个t值。3. 时间成分分离的模型选择三套主流方案对比3.1 双GLM简单、可解释但别忽略HRF假设双GLM就是把起始和持续两个事件分开建模直接估计两个beta。优点是简单直接、软件支持广泛。缺点是它依赖一个先验假设HRF是标准双gamma形状。实际上颞上回后部和前部的HRF形状是有差异的后部偏快前部偏慢且幅度更低。如果用标准HRF统一建模持续成分的幅度可能被低估。我自己的处理方式先用标准HRF跑一版再跑一版带时间导数的模型把两个版本的结果并排对比。如果加了时间导数之后起始beta图的空间分布发生明显漂移说明原始模型对时间动态的拟合不足需要考虑FIR或TRF。不要一开始就把时间导数、离散导数、持续窗口全部塞进模型那样回归量之间的共线性会高到难以解释。3.2 FIR没有固定波形假设更接近“让数据自己说话”FIR有限脉冲响应模型的做法是把每个刺激事件之后若干秒分成连续的时间仓逐仓估计响应幅度得到每个体素或顶点的平均响应形状。TR2秒时我一般用8秒的估计窗口共4个仓然后定义第一仓为起始主导后两仓为持续主导。这个方法的优点是HRF形状不再被强制预设能直接看到颞上回不同位置响应峰值的延迟差异。缺点同样明显FIR的自由度高对噪声敏感很容易在高频噪声下过度拟合。解决办法是用脊正则化或者把多个试次的估计值先做降维取前两个主成分后再进入组分析。在MEG/EEG的源空间上FIR的思路非常普遍尤其是配合beamformer做源定位时先估计各源的时间窗平均幅值再拿去做空间差异图比直接比较某个固定时间点的电流密度更稳。3.3 TRF/编码模型毫秒级时间分辨率适合MEG/EEGTRF时域响应函数temporal response function是连续语音脑成像中相当成熟的方法。用语音包络、音高、频谱特征作为输入在延迟维度上估计单位脉冲响应。在MEG/EEG上TRF的时间分辨率可以做到1毫秒所以可以非常精细地区分起始响应窗口和持续响应窗口。在源空间层面我会对每个源位置分开估计TRF然后把延迟方向上的幅值分成早期和晚期两个窗口再做source-level的对比图。早期窗口对应起始驱动成分晚期窗口对应持续保持成分。这个方案对连续语音材料特别合适因为你不用把刺激切分成一个个独立事件可以直接从头到尾用自然句子建模。TRF在fMRI上并不常用因为血氧信号本身相当于一个慢低通滤波器HRF反卷积存在病态问题。如果非要在fMRI上借鉴这个思路需要先测量个体HRF再在时域上做正则化反卷积复杂度和不确定性都比较高不如直接回到双GLM或FIR。3.4 选型建议没有绝对最优只有场景最优方法时间分辨率空间分辨率假设强度计算成本推荐场景双GLM低秒级体素/顶点中高依赖HRF低fMRI快速分析、ROI验证FIR低到中数个TR体素/顶点中依赖时间窗定义中无HRF假设探索TRF高毫秒级源/传感面中高依赖输入特征高MEG/EEG连续自然言语对于大多数fMRI项目我的默认方案是先跑双GLM形成第一版空间图谱。如果发现前后梯度稳定再挑若干关键顶点用FIR验证。对于MEG/EEG项目直接用TRF会更高效省去很多手工切分事件的工作。4. 实测图谱的典型模式起始峰、持续平台与前后轴梯度4.1 起始反应主要集中在后部STG的瞬态检测区从我处理过的几个自然言语数据集来看起始反应的组平均峰值总是落在Heschl回后外侧和颞平面的位置再向STG后三分之一延伸。这个分布和听觉通路上“对包络跳变进行高时间分辨率分析”的角色是一致的。尤其是塞音、辅音丛这类声学瞬态特征明显的音节起始反应的峰值更高、范围也更集中。左半球和右半球都存在起始反应但左半球的峰值位置往往略微向前偏移。这可能是左侧颞上回更早参与音位特征抽象的结果。在做图谱时我不会只看峰值体素还会看起始反应的空间范围是否局限在STG而不是扩散到颞中回。如果扩散范围过大通常说明预处理或共线性有问题。4.2 持续反应更靠近中前部STG但不等于“纯声学稳态”持续反应的空间位置相对偏前多见于STG中段和前段并经常向颞上沟方向延伸。与起始反应不同持续反应对“语音是否具有意义”非常敏感。同一个句子反向播放后频谱包络大体还在但持续反应会明显下降这说明持续成分不只是简单的能量维持还涉及到词汇语义和句法结构在时间轴上的累积整合。这种效应在平行实验设计里很容易验证。把句子分成短句和长句长句的持续反应幅值明显更大而起始反应的幅值几乎不受句子长度影响。所以如果你在一张图谱里看到前部STG持续反应随句子长度线性爬升这说明你抓到的不是声学稳态而是更高一级的语言累积过程。右半球的持续反应也有但它的触发条件更“声学化”。对旋律轮廓、音高变化、韵律包络的长时间追踪右半球STG中前部的持续反应会更明显。这并不意味着左右半球完全分工而是它们对持续输入的不同维度有不同偏好。图谱解读时宜同时看左右两个半球不要只盯着左侧。4.3 前后轴梯度不是两个孤岛而是一条连续过渡带把起始和持续的beta值放到同一个坐标系里看很难找到一个将两者截然分开的边界。更常见的情况是一条沿STG前后轴的连续梯度后部以起始反应为主导中段开始两者混合前部以持续反应为主导。为了量化这种过渡我习惯在每个体素或顶点上计算一个比值ratio (beta_onset - beta_sustained) / (beta_onset beta_sustained)这个比值正数越大越偏起始主导负数越大越偏持续主导。与直接显示两套beta图相比比值图的好处是压缩了总体幅度差异只保留成分方向信息等于直接把“梯度”变成了一张图。不过我会同时保留原始beta图因为比率在信噪比低的区域会被放大噪声。在实际报告中原始beta图和ratio图放一起展示读者才不会被单一指标误导。个体水平上前后梯度不一定很干净。有些被试的起始峰和持续峰离得很近只有到了组平均层面梯度才变得平滑。所以在做图谱结论时至少要报告组水平的稳定模式和个体水平的代表性样例。单独用一两个被试的图去证明“有梯度”说服力很弱。5. 质量把控与常见坑从伪影到统计推断5.1 头动和生理噪声会伪装成时间差异颞上回所处的位置很容易受两类伪影干扰。第一类是头动尤其是头部微小的刚体平移和旋转。第二类是生理噪声心跳搏动、呼吸气流都会在颞叶附近产生周期性信号经过HRF卷积后会像慢波一样混进数据。起始反应和持续反应受伪影影响的方式也不同。起始反应锁时到刺激开始如果被试在听到刺激后有下意识的吞咽或头部调整会把一个纯头动伪影锁进“起始”时间窗持续反应则更容易被基线漂移和呼吸波动污染。我的处理办法是在设计矩阵里加入头动的24参数扩展模型同时加入aCompCor生成的生理噪声成分之后才做起始/持续对比。如果只是用6参数头动模型往往不够。还有一个日常容易被忽略的点语音刺激本身会诱发被试外侧裂区域的听觉响应但如果情绪唤醒度高或任务指令复杂被试可能有小的动作反应。办法很简单在设计时把“作答时间”单独分离出来或者让被试在刺激结束后延迟3秒再按键避免动作事件和持续反应窗口重叠。5.2 共线性诊断两个回归量经常“手拉手”有些数据集跑完后起始和持续beta图整片都呈正相关怎么看都不像分离。这经常不是神经信号而是设计矩阵出的问题。同一刺激如果时长变化范围太小onset和sustained两个回归量在时间轴上的形态会很接近相关系数超过0.6甚至0.8。这时去解释“哪个脑区起始、哪个脑区持续”就完全不可靠。我一般会在一级分析结束后先看设计矩阵的相关矩阵或者算VIF设一个简单阈值VIF超过5就回头补实验设计而不是在统计层面强行正交化。有朋友会问能不能用正交化处理共线性答案是不推荐。正交化会改变beta的语义让它不再对应原始成分的幅度而且结果对正交化的顺序敏感极难解释。如果确实不能重收数据一个折中方案是改用FIR模型通过多时间仓拟合提取响应形状再从中定义起始和持续尽管仍受共线性影响但至少能看到时间响应的真实样貌报告时也更诚实。5.3 多重比较校正与可复现性图谱不是阈值的产物空间图谱的价值取决于它是否能经受统计校正。两套图谱叠加展示时很容易在低阈值下出现大片的“彩色脑图”好看但不稳。我建议对所有顶点/体素级别统计使用FDR或者基于团块的非参数置换检验。对fMRI组分析可以使用SnPM或FSL的randomise做置换这样既处理多重比较又不需要假设多元正态分布。另一个我始终坚持的步骤是split-half一致性验证。把每个被试的试次随机分成两半分别估计起始图谱和持续图谱再计算两半图谱的空间重叠率或相关。如果0.5的重叠率很低说明图谱很不稳定也许需要更多试次或更好模型。这个步骤不花太多时间却能让审稿人和临床合作者放心。需要注意的是不要在同一个数据集上反复切阈值找“理想图谱”。我会提前确定阈值和对比指标然后只报告一版结果。如果实在需要探测性分析就明确标注它为探索性结果并降低结论等级。这个习惯能避免很多事后解释的问题。6. 这套空间图谱能做什么临床应用与认知模型约束6.1 临床上的直接用途术前定位、术后预测与功能评估临床影像里经常要回答“这个患者颞上回的语言功能到底靠哪一块脑区”。传统做法是让病人在扫描仪里做听觉任务然后看哪个团块激活。把起始和持续分开后可以提供更多层信息。比如术后语言功能的保留程度并不只取决于激活团块大小更取决于关键峰的位置是否被切除。如果持续反应的关键峰位于前外侧而手术计划刚好切到那里就需要更谨慎。对失语症患者恢复期的一个常见现象是起始反应逐渐恢复但持续反应仍然偏低。两者分离可以提供一个比“总激活强度”更敏感的纵向观察指标。人工耳蜗植入后的皮层重组评估也可以这么做起始图谱反映脑干和听觉皮层对电刺激瞬态的接收能力持续图谱则反映听觉皮层对连续刺激维持格式化的状态。只看总激活会把这两个系统的变化混在一起。6.2 认知模型约束预测编码和时间感受野从认知模型角度看起始反应和持续反应的图谱差异可以用预测编码框架来理解。起始瞬态是对环境中新事件产生预测误差的高潮持续反应更像是对当前输入状态的维持用于与自上而下预测做持续比较。如果一张空间图谱显示后部STG只对瞬态敏感、前部STG持续参与那就给“预测误差发生在后部、模型维持发生在前部”提供了结构约束。对计算模型尤其是语音识别和听觉语言大模型这套图谱可以作为回归目标。把模型内部某一层的隐藏状态映射到被试的神经响应分别拟合起始和持续反应。如果某个模型层可以同时预测起始图谱和持续图谱说明它的内部动态与生物听觉皮层的时间结构更接近。这种验证目前在听觉神经科学里很流行而图谱本身是否区分了起始和持续会直接影响模型解释的准确性。6.3 下一步扩展把图谱接上高密度电生理和病灶分析如果你手头只有fMRI空间图谱可以考虑把它和颅内电生理数据做桥接。ECoG在颞上回有毫米级采样时间分辨率也在毫秒级很适合验证fMRI图谱上的前后梯度是真实神经放电还是血流动力学造成的假象。把ECoG每个电极的high-gamma起始响应和持续响应投影到同一个皮层表面上可以和fMRI图谱对比。我做过的几次对比显示fMRI上的持续图谱与ECoG的slow sustained high-gamma响应基本吻合但起始图谱在fMRI上会显得更靠后可能是HRF延迟造成的局部偏移。病灶分析是另一个实用扩展。对有STG病灶的卒中患者把病灶mask叠加到组水平图谱上如果病灶位置与持续图谱重叠更大则语言理解损伤往往更重如果只与起始图谱重叠更多表现为听觉加工迟缓而非理解缺陷。这种基于图谱的病灶-症状映射能帮助临床团队把“颞上回损伤导致言语障碍”这类宽泛结论细化成可操作的判断。在写个人经验总结前最后分享一个复现技巧每次分析先把设计矩阵和相关图打印出来贴在工作记录里再进行空间图谱的生成。很多看起来漂亮的皮层图追溯回去就是当时没检查共线性和平滑参数造成的。图谱这个产物很容易让人盯着视觉结果看反而忘了统计质量。我自己的经验是无论用什么方法先把数据质量、模型假设、个体解剖对齐这三件事做到位图谱自然会变得稳定且可信。