SevenTnewS

人工智能与神经科学

语言模型被扰乱神经元后,精准复现了中风对语言的影响

研究人员扰动LLaVA 1.6以模拟失语症患者的图片命名错误,在79.5%的案例中,成功匹配了多达七个错误类别中的个体患者轮廓。在六种错误类别中,有六种自然地出现在不同的扰动配置下,这表明通用多模态模型可以充当中风后语言障碍的数字孪生。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-24 · 阅读需 6 分钟

语言模型被扰乱神经元后,精准复现了中风对语言的影响
来源 : arXiv preprint …

几十年来,研究中风引起的语言障碍的唯一途径是通过人类患者、他们的扫描、他们的测试、他们缓慢的康复。南卡罗来纳大学的研究人员与合作者发表的一篇新预印本彻底颠覆了这种模式:他们发现,故意损坏一个通用多模态语言模型,会产生与失语症患者相同的系统性命名错误。

这篇论文《受损的多模态语言模型再现失语症图片命名模式》于2026年7月发表在arXiv上,超越了AI研究中常见的基准测试狂热。作者们不问模型能否在测试中取得更高分数,而是问它能否像人类一样失败。答案是,在近300名患者的测试中,答案是响亮的“是”。

七种错误类别中复现了六种

由Yong Yang领导的研究团队使用了LLaVA 1.6,这是一个同时处理图像和文本的开源多模态模型,他们通过改变应用的层、比例和噪声量,系统地扰动了其内部单元。然后,他们将费城命名测试中的图像输入模型,并使用经过验证的神经分类器将其响应分为七类。这些类别包括正确响应、语义错误、混合错误、无关错误、新造词、无响应和形式性错语(发音相似但词语错误)。

其中六种在扰动参数空间的不同区域以临床可比较的比例出现。唯一的例外是形式性错语,模型未能以匹配临床数据的速率产生该错误。这一差距本身具有启发性;它表明支撑基于声音的词汇检索的认知架构可能依赖于当前多模态模型未能完全捕捉的机制。

“搜索扰动空间发现了能够为97.8%的失语症患者(PWAs)在至少六个类别中复制个体错误轮廓的配置,并为79.5%的PWAs复制了全部七个类别,”作者写道。

这些结果并非随机重叠的偶然结果。研究团队运行了蒙特卡洛基线测试,以确认匹配反映了联合类别间结构, , 即人类患者中错误共现的方式, , 而不是简单的边际重叠。模型的错误显示出与人类错误相同的统计特征,而不仅仅是相同的总体比例。

从基准分数到行为真实性

视角的转变意义重大。多年来,AI研究人员将语言模型视为在标准化测试中最大化准确性的工具。这篇论文采取了根本不同的方法:将模型视为人类认知系统的模拟物,包括其失败模式。

将LLM用作认知模型的想法并非全新;早期研究已使用像GPT这样的模型来模拟人类记忆和推理的某些方面。但这项研究首次将损伤, , 即蓄意、可控的破坏, , 应用于多模态模型,并将产生的错误与真实患者的大规模临床数据集进行比较。规模引人注目:278名失语症个体,每人都有数百次命名试验的详细错误轮廓。

该框架类似于经典的神经心理学,其中研究人员从局部损伤患者的行为中推断大脑功能。在这里,损伤是虚拟的, , 一种应用于神经网络特定层的噪声向量, , 但行为输出与实际临床数据高度匹配。

失语症康复的数字孪生

临床意义是本文最引人注目的部分。如果单一的扰动配置能够复现单个患者的完整错误轮廓,那么该模型实际上就成了该患者语言系统的数字孪生

对临床医生而言,这样的数字孪生将是一个沙盒:一个无需患者在场就可以测试不同治疗干预措施的地方。言语病理学家可以模拟特定错误模式如何对不同提示策略作出反应,或者随着底层神经架构的自我修复,康复可能如何进展。该模型提供了一个受控环境,可以在没有人类受试者研究的伦理和后勤限制的情况下测试关于语言处理的假设。

作者明确承认了这一潜力:“这些结果建立了一个定量框架,用于在图片命名中再现个体失语症的错误模式。它们表明语言模型有潜力作为中风后失语症个体的数字孪生。”

但从研究结果到临床工具的道路漫长。该论文仅测试了图片命名这一狭窄任务,而失语症患者面临的挑战还有很多。真正的康复涉及对话、阅读、写作和手势。所使用的模型LLaVA 1.6远非最先进;结果如何推广到更新型号尚属未知。

为什么形式性错语难以复现

缺失的类别, , 形式性错语, , 值得仔细审视。在临床实践中,形式性错语涉及产生一个听起来像目标但错误的词,例如说“桌子”而不是“电缆”。这些错误被认为反映了音韵处理的中断,而非纯粹的语义或视觉混淆。

LLaVA 1.6的当前架构可能无法以捕捉这种易感性的方式处理语言的音韵结构。如果是这样,这一差距直接指向了一个特定的认知过程, , 音韵检索, , 即模型的表征未能完全复制的部分。这本身就是一个具有神经科学价值的发现。

这对该领域意味着什么

这篇论文位于AI、计算神经科学和临床实践的交汇点,这三个领域很少以这种严谨程度重叠。对AI研究人员来说,它提供了一个新基准:行为保真度,而不仅仅是测试准确性。对神经科学家来说,它提供了一个假设生成机器:如果模型与患者犯同样的错误,那对患者的基础处理意味着什么?对临床医生来说,它为未来开启了一扇门,使患者特定的模拟成为标准工具包的一部分。

作者依赖蒙特卡洛基线来确认错误轮廓结构,为容易过度声明的领域增添了严谨性。匹配不仅在粗略层面上是一对一的,而且捕捉了错误类型的联合分布, , 这是一个更难通过的测试。

尽管如此,该论文仍是一份预印本,而非同行评议的出版物。结果的临床意义有待于用其他模型、其他任务和其他患者群体进行重复验证。而将AI作为人类患者代理的道德层面,包括所有可能的误解和过度依赖风险,几乎没有涉及。

但明确的是,问题已经转变。问题不再是语言模型能否模仿人类表现,而是通过模仿人类的失败,模型是否能教会我们关于人脑的新东西。这篇论文表明答案可能是肯定的。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。