← 文章 / AI技术
MIT Tech Review 6小时前 · 2026-10-01 19:30:05 · 4 阅读

AI“读心”工具可通过脑扫描重建图像

核心要点

一款新的 AI 工具只需分析你的脑部扫描图像,就能猜出你正在看什么,并以相当高的精度重建出这幅图像。它还能反过来运作:根据一个人正在看的内容,预测他的大脑活动。

比如在上图中,每组图片里左边是用户实际看到的内容,右边则是模型根据脑部扫描重建出的图像。

这款工具由以色列雷霍沃特魏茨曼科学研究所的 Michal Irani 和同事共同开发。Irani 希望这个“读心”工具最终能帮助人们进一步了解大脑的工作机制,或许还能用来帮助闭锁综合征患者进行交流,或者让科学家重建梦境的内容。

加拿大不列颠哥伦比亚大学神经病学教授、神经伦理学家 Judy Illes 并未参与这项研究,但她称这项工作“了不起”。她说:“用这种方法帮助神经系统疾病患者……进行治疗的设想,实在令人兴奋。”

但也有科学家警告说,类似的方法可能被用来窥探人的内心想法和心理意象,而且可能是在未经本人同意的情况下。“研究结果看起来非常令人惊艳,”加州大学圣塔芭芭拉分校的神经科学家 Tommy Sprague 说。

“但如果存在一种方法能暗中提取你正在想什么……那科幻小说里写了150年的情节随时都可能成真,这在很多方面都令人担忧。”

窥探大脑

多年来,神经科学家一直在尝试重建人们看到的内容,以及他们脑海中正在发生的事情。最早的尝试生成的图像模糊不清、难以辨认。随着技术的进步——无论是 fMRI 扫描本身,还是用于解读结果的工具——重建效果多年来不断改善。

Irani 和同事的研究从分析公开可用的脑部扫描数据入手。此前已有其他研究人员收集了志愿者的扫描数据:这些志愿者躺在 fMRI 扫描仪中,观看了数百张图像。

fMRI 利用强磁体追踪大脑中富氧血流的流动。fMRI 扫描图中那些“亮起来”的大脑区域,被认为是当下特别活跃的部位。不过它们的特异性并不高——在传统 fMRI 扫描仪中,每个被高亮的活跃“体素”体积约为 3 立方毫米,包含大约 16,000 个神经元。

但 Irani 及其同事使用的是分辨率更高的扫描仪采集的最新数据集。Irani 表示,这些扫描仪的每个体素仅覆盖约 1 立方毫米的神经元区域。这些数据展示了志愿者观看不同图像时的脑部活动状态。

其他团队也做过类似尝试,一些其他工具也被用于根据脑扫描数据重建图像。但 Irani 认为,这些工具的效果还不够好。举例来说,如果一个人看到了一根香蕉,这些模型确实能生成一张香蕉图,但看起来会不一样,她说,“它不会有相同的结构和位置。”

更好的解码器

该团队希望更精准地重现被观看过的图像。第一步是利用现有数据训练一个 AI 模型,这些数据来自 8 名志愿者,他们在高分辨率 fMRI 扫描仪中分别观看了约 9,000 张图片。

关键在于,他们的“脑解码器”包含两个分支:一个用于预测图像的结构(例如颜色的位置),另一个用于预测其内容(例如盘子里的一串香蕉)。这些预测让 扩散模型(一种最擅长通过逐步清除像素噪声来生成视频和图像的 AI 类型)能够生成对所见内容更准确的再现。

但为了改进模型,他们需要更多数据——远多于实际可用的数据。

为了解决这个问题,她及其同事反方向训练了另一个模型——一个可以从图像预测脑部活动的 编码器。随后,团队将编码器与解码器结合使用,从而同时提升了这两种工具的性能。

原理是这样的:首先准备一张新图片,比如一只豹子。接着用编码器预测当一个人看到这张图时,其 fMRI 脑扫描会呈现什么样子。然后,解码器利用这些预测数据反向重建图片。一开始,重建出的图像可能看不出豹子的影子,Irani 说。但通过反复以这种方式训练模型,效果最终会有显著提升。

这种方法还允许团队使用任意数量的图片来训练模型,即使这些图片从未在 fMRI 扫描仪中展示给过任何人。Irani 表示,大约 70% 的训练数据来自那些原本没有配对 fMRI 扫描结果的图片。

通过整合多项研究的数据,团队还识别出了一些在大脑中似乎具有通用功能的区域。例如,一个区域会对食物图片产生反应,而另一个区域则对运动图片有反应。这位计算机科学家表示,她目前正在与神经科学家合作,“看看我们能否利用开发出的这些工具,真正发现关于大脑的新知识。”

生成的“通用大脑编码器”只需极少校准,就能适用于新个体的扫描数据。以往,要预测某个人正在看什么,通常需要约 40 小时的新个体 fMRI 数据作为基础。而 Irani 说,她的解码器只需要一小时的 数据。这项研究成果上月在纽约举办的“认知计算神经科学会议”上公布。会议官网

Sprague 认为,这可能对研究大脑的神经科学家很有价值。“我们没有能力为新受试者承担 40 小时的成像成本,”他说。“每小时的费用大概在 $600 到 $1000 之间。”他表示,这类工具可以加速研究工作。

技术前沿

编码器和解码器并不完美。“当然会有失败的情况,”Irani 说。在一次 Zoom 通话中,她指出,她的工具曾把一张蛋糕图片重建成了三个叠在一起的三明治,还把一只在浴缸里的狗误认成了颜色相近的、同样在浴缸里的山羊。

但它们代表了当前技术的最先进水平。在一项对比测试中,该工具的表现远超之前报道过的同类工具。“总体而言,我们的性能显著优于其他方案,”Irani 说。她还补充道,“读心术”这个名字虽然俏皮响亮,但只是她们工作的一种通俗叫法。

Irani 目前正计划把研究方向从图像扩展到视频和音频。她希望能够重建人们在思考或想象什么,甚至解析梦境的内容。“这目前还做不到,”她说,“但我们正在朝这个方向努力。”

她说,这样的工具还可能让“闭锁综合征”患者——那些完全瘫痪的人——仅凭大脑活动就能与外界交流。它也能帮助科学家破解一些关于大脑运作的长期谜团,比如 PTSD 闪回时人们脑海里到底是什么画面。

这类技术进步不可避免地引发了对心理隐私的担忧。如果有人恶意利用它,把一个人脑海中的画面重现出来,回放他们的想法或所见,那该怎么办?

“你要是十年前问我这个问题,我会大笑不止,”Sprague 说。让一个人安静地躺在扫描仪里、主动配合研究问题已经很不容易,更别提违背本人意愿这么做了。但 Irani 和其他科学家正在研究类似的方法,试图通过 EEG 来解码大脑活动——即通过电极帽,甚至通过耳机采集的脑电信号。

随着模型不断改进,用这种方式采集的脑电信号会越来越容易分析。“我们对伦理问题的考量必须更认真一些,”Sprague 说。他认为 Irani 的方法在预测一个人心中想象(而非亲眼看到)的图像上,应该也能“表现得相当好”。

德国慕尼黑工业大学的神经科学家兼哲学家 Marcello Ienca 说,转向 EEG 将是“改变游戏规则的一步”。一旦 EEG 设备针对某个用户的大脑完成校准,企业想要从这个人脑中提取更多信息就相对容易了——而且可能是在未经其同意的情况下。Ienca 还设想,某些法院可能会允许把心理图像重建的结果作为法律证据。

“我毫不怀疑这是出于好意的研究,但同样很明显,它可能被挪作……在伦理和社会层面都有问题的商业用途,”他说。

Irani 承认使用 EEG 确实存在被滥用的风险,但她目前并不担心。“我尽量只往好处想,”她说。

原始来源: MIT Tech Review

评论 (0)