欢迎光临
我们一直在努力

fMRI 能把故事“复述”出来吗?Tang 2023 非侵入式语义解码器精读

fMRI 能把故事“复述”出来吗?Tang 2023 非侵入式语义解码器精读

原论文:Semantic reconstruction of continuous language from non-invasive brain recordings 作者:Jerry Tang, Amanda LeBel, Shailee Jain, Alexander G. Huth 期刊:Nature Neuroscience,2023 DOI:10.1038/s41593-023-01304-9

30 秒看懂这篇论文

  • 问题:能否用非侵入式 fMRI 从连续自然语言的脑活动中恢复意义,而不是只分类几个词?
  • 方法:用预训练语言模型表示候选词序列,以 voxel-wise 编码模型预测 BOLD,再通过 beam search 寻找最符合脑响应的文本。
  • 结果:三名主要被试中,72%–82% 的时间点在 BERTScore 上显著;输出常保留事件和语义,却很少逐字一致,WER 仍高达 0.92–0.94。
  • 扩展:模型可迁移到想象语言、无声电影和选择性注意场景。
  • 边界:每人需要约 16 小时训练扫描,主分析仅 3 人;这是合作条件下的语义释义,不是精确思想转录。

1. 从“哪个词”到“连续意义”

语言脑解码长期受 fMRI 时间分辨率限制:一个 BOLD 样本混合了数秒内许多词,无法像语音识别那样逐帧对齐。Tang 等人的巧思不是强迫 fMRI 输出精确词序列,而是把任务改写为:在语言模型给出的许多合理续写中,哪一个最能解释当前脑活动?

因此,论文的“semantic reconstruction”非常准确。输出往往是原意的改写。例如人物、地点和动作关系能够保留,但具体措辞会变化。把它称为“逐字读脑”会掩盖 WER 与 BERTScore 之间的巨大差异。

Figure 1:语言解码器架构与示例重建

来源:原论文 Figure 1,PDF 第 2 页;由原论文页面裁切,DOI: 10.1038/s41593-023-01304-9。

2. 数据:三个人,每人听约 16 小时故事

主要实验为 3 名被试。每人聆听 82 个自然叙事故事,训练数据约 16 小时,来源包括 The Moth Radio Hour 与 Modern Love;测试使用训练中未出现的故事,并以单次测量进行重建。研究总计涉及 7 人,用于附加的跨被试与隐私分析,但最重要的连续语言结果仍建立在 3 名高度训练的个体上。

自然故事比孤立词更接近真实语言,也带来强上下文相关性:听到“他走进餐厅”后,语言模型已经能猜测许多合理后续。论文的任务正是把这种语言先验与脑证据结合,所以必须区分“语言模型自己会续写”与“脑活动改变了候选排序”。

3. 模型:生成候选,再用脑活动打分

系统包含三个部件。第一,预训练 GPT 类语言模型把词序列映射为语义特征。第二,对每个 voxel 拟合 L2 正则化编码模型,预测一段语言在该 voxel 中的 BOLD 响应。第三,语言模型逐步提出候选续写,beam search 保留那些既语言自然、又与实测脑响应一致的序列。

可把候选文本

S

S

S 的选择简化写成:

S

^

=

arg

max

S

[

log

P

L

M

(

S

)

+

λ

log

P

(

r

S

)

]

\\hat S=\\arg\\max_S\\left[\\log P_{\\mathrm{LM}}(S)+\\lambda\\log P(\\mathbf r\\mid S)\\right]

S^=argSmax[logPLM(S)+λlogP(rS)]

第一项是语言先验,第二项是脑响应似然,

λ

\\lambda

λ 控制两者权衡。若只靠语言模型,输出可能流畅但与被试所听内容无关;若只靠低信噪比 fMRI,搜索空间又几乎不可管理。方法的价值就在于把两种不完整信息组合起来。

4. 结果:语义相似很强,逐字准确很弱

论文同时报告 WER、BLEU、METEOR 与 BERTScore。三名被试的 1,839 词测试故事中,72%–82% 时间点的 BERTScore 显著高于控制;但 WER 约为 0.92–0.94。也就是说,多数词并没有被精确还原,而语义级嵌入仍能识别出大量正确内容。

这并不矛盾。参考句“我还没有驾照”,输出“她甚至还没学会开车”,逐词几乎不同,却表达相近事件。对辅助沟通而言,这类释义或许有用;对法律陈述、隐私判断或语言神经科学而言,逐字错误则不能被忽略。

5. 哪些脑区真正提供信息?

Figure 2:不同皮层区域对解码的贡献

来源:原论文 Figure 2,PDF 第 4 页;由原论文页面裁切,DOI: 10.1038/s41593-023-01304-9。

Figure 2 通过限制或扰动不同区域的 voxel 说明,语言重建依赖一个分布式语义网络,而非单个“语言中心”。高层语言相关皮层提供大量可解码信息;不同区域组合对结果的贡献也与已知语义选择性相容。

但 voxel 的可预测性不等于该区域独立“存储一句话”。fMRI 中相邻认知过程、注意和故事结构高度相关,编码权重反映统计解释力,不直接等于因果必要性。更稳妥的结论是:分布式皮层活动包含可由语言模型特征捕捉的连续语义信息。

6. 迁移:想象语言、电影语义与选择性注意

Figure 3:跨任务应用与隐私实验

来源:原论文 Figure 3,PDF 第 6 页;由原论文页面裁切,DOI: 10.1038/s41593-023-01304-9。

同一解码器无需针对每项任务重新训练,就能用于被试在脑中想象讲故事,以及观看无声电影。想象语言中 41%–74% 的时间点达到显著语义解码,无声电影为 21%–45%。这说明模型捕捉的不只是声学输入,而是跨形式的事件语义。

在两名说话者同时出现时,输出更接近被试主动注意的故事,提示注意可以门控可解码内容。这个实验很有应用意义,但不能理解为解码器自动分离所有内在思想:任务仍有明确刺激、指令和同步时间线。

7. 隐私实验:目前需要合作,但不能把它写成永久保证

作者主动测试两种保护因素。将一名被试的模型直接用于另一人,单靠解剖配准几乎失效,说明个体化训练很关键。让被试做数数、想动物名称或想另一个故事等认知抵抗任务,也会显著降低解码质量。现阶段,长时间静止扫描、配合训练和注意目标内容都是必要条件。

这只能支持“当前系统难以在不合作时运行”,不能推出“非侵入式语义解码永远没有隐私风险”。跨被试对齐、更强基础模型和更便携成像都可能改变边界。论文最成熟的态度,是把技术限制当作当前证据,而不是伦理豁免。

8. 错误从哪里来?

Figure 4:语言重建误差的来源

来源:原论文 Figure 4,PDF 第 7 页;由原论文页面裁切,DOI: 10.1038/s41593-023-01304-9。

Figure 4 将误差分解到脑记录、编码模型和语言生成搜索。fMRI 噪声会模糊时间点;编码模型可能遗漏某些语义维度;语言模型则倾向生成高概率、语法流畅的表达。当脑证据弱时,先验会“合理化”输出,使文本看起来像故事,却可能在主体、否定或具体细节上出错。

这也是阅读所有生成式脑解码论文的通用原则:输出质量来自“脑信号 × 生成先验”。漂亮或流畅的结果并不能单独证明神经信息丰富,必须与无脑输入、错配输入、语言模型基线和扰动实验比较。

9. 局限与可复现性

第一,主要样本只有 3 人,且每人约 16 小时扫描,离普适系统很远。第二,fMRI 设备昂贵、不可移动,血氧响应延迟使实时交流困难。第三,BERTScore 对语义释义友好,但会弱化否定词、角色交换等关键错误,必须与 WER 和人工检查并读。第四,故事上下文提供强先验,开放对话和无提示内在语言是否同样可解码并未证明。第五,训练时长曲线在约 7.5 小时后才逐渐趋缓,个体成本仍高。

论文公开了大部分数据,主要数据可从 OpenNeuro 获取,给独立复现提供了良好基础;抵抗任务等部分数据因隐私原因不完全公开。复现还需要注意语言模型版本、候选搜索参数和 fMRI 预处理,因为这些都可能改变文本输出。

总结

Tang 2023 把非侵入式语言解码从封闭标签推进到连续自然语义:语言模型生成候选,个体化 fMRI 编码模型提供脑证据,beam search 完成组合。它能复述大量故事含义,并迁移到想象与无声电影,但 WER 仍接近 1,远非逐字转录。最准确的评价是:这是一台需要高度合作和长时个体训练的“语义释义器”,不是通用读心机;同时,它也让脑解码的隐私讨论第一次有了可量化实验基础。

参考资料与图片来源

  • Tang, J., LeBel, A., Jain, S., & Huth, A. G. (2023). Semantic reconstruction of continuous language from non-invasive brain recordings. Nature Neuroscience, 26, 858–866. DOI: 10.1038/s41593-023-01304-9。
  • 文中 Figure 1–4 均来自原论文 PDF;未使用生成图片、重绘图或二次转载图。
赞(0)
未经允许不得转载:171主机测评 » fMRI 能把故事“复述”出来吗?Tang 2023 非侵入式语义解码器精读
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址