人工智能
双记忆系统教会AI诊断它总是忘记的故障
OpsMem将短期记忆(STM)用于追踪不断演变的诊断状态,与长期记忆(LTM)用于存储可重复使用的操作经验相结合。通过一种称为跨记忆共振(CMR)的机制,系统从LTM中激活与状态相关的经验,以指导多智能体诊断。在一个华为微服务数据集上,其性能显著超过了基于智能体推理和知识增强的基线方法。

当云服务发生故障时,工程师的大脑会做出一件当前任何AI诊断系统都未能做到的事情:在工作记忆中保持对当前故障的理论,同时调动多年处理类似症状的经验。这种即时与积累之间的无缝协作如今已被形式化为一个名为OpsMem的软件框架。
两种记忆,一个目标
OpsMem由南开大学、华为及其他中国机构的研究人员在一篇预印本论文中详细介绍,提出了一种用于故障诊断的双记忆架构。该框架维护一个短期记忆(STM), , 一个捕获当前故障的症状、证据和候选假设的图,以及一个长期记忆(LTM), , 一个将跨故障的操作经验组织成模式、案例和程序的独立图。
这不仅仅是一个拥有更好索引的检索增强生成(RAG)系统。其关键创新在于作者所称的跨记忆共振(CMR)过程,该过程在每个诊断轮次中运行。CMR首先从STM中提取症状和证据节点,通过LLM将它们归一化为查询信号,然后将这些信号与LTM模式中嵌入的信号进行匹配。得分超过阈值的模式被激活,激活传播到相关的案例和程序,从而生成一个定制的LTM子图,为下一轮多智能体诊断提供条件。
关键数据
在华为生产微服务系统的120个真实故障案例上进行测试后,OpsMem在使用Qwen3.5-27B作为基础LLM时,Match分数(精确根因匹配)达到78.33%,Relevant分数(至少部分相关)达到85.83%。最强的基线方法GoS结合LinearRAG分别达到53.33%和72.50%。这意味着在精确匹配准确率上提高了46.88%,在相关性上提高了18.39%,均优于最佳竞争对手。
这种改进在三种不同的基础LLM(Qwen3.5-27B、Gemma-4-31B和GLM-4-32B)上均保持一致,表明收益来自于架构本身,而非特定的骨干模型。
消融实验揭示的真相
论文的消融研究精确地揭示了改进来自何处。完全移除LTM导致性能下降最大,Match从78.33%降至30.83%,确认了操作经验是最重要的单一因素。移除STM后Match降至45.00%,表明显式的状态追踪对于长时间跨度的诊断是必要的。在没有CMR的情况下(即使用静态检索而非状态对齐的激活),Match降至56.67%。而如果没有LTM整合(将已解决的故障案例提炼回LTM的机制),Match降至70.83%,这是一个较小但仍显著的下降,表明随着系统积累已解决的案例,它确实能够随着时间的推移而改进。
为什么当前方法效果不佳
现有方法分为两类:基于智能体推理的方法(如ReAct和GoS)组织诊断轨迹但缺乏操作经验,以及知识增强方法(如VectorRAG和GraphRAG)检索外部知识但未能将其与不断演变的诊断状态对齐。
“在实际运维中,工程师通过迭代收集证据、分析观察结果和根据操作经验改进假设来诊断故障,”作者写道。“基于智能体推理的方法强调诊断状态,而知识增强方法强调操作经验。然而,有效的诊断需要两者紧密结合。”
这种结合正是CMR所实现的。例如,当STM包含数据库连接处于休眠状态的证据时,CMR会激活与空闲槽位占用相关的LTM模式,而非一般的过载模式, , 这是经验丰富的工程师会做出的联想式跳跃。
自我进化:从已解决的故障中学习
也许最有趣的发现是系统随时间改进的能力。研究人员顺序处理了120个故障案例,允许OpsMem在每个诊断后将经过验证的经验整合到LTM中。与保持初始LTM不变的变体相比,OpsMem在每连续30个故障的窗口中都正确诊断了额外的故障,其中最大的精确匹配增益出现在最后一个窗口中。
这表明LTM整合并非噱头,而是真正的能力:每个已解决的故障都通过新的模式、案例或程序丰富了LTM,使系统在未来的诊断中逐步变得更好。
局限性与未解问题
仍有几个问题未得到解答。实验仅依赖于华为的一个数据集,且LTM最初是通过访谈、问卷调查和操作文档构建的,这是一个劳动密集型过程,可能难以大规模复制。阈值设置(信号和模式激活均为0.6,模式、案例和程序保留前3个,最大诊断轮次为3)在实验中是固定的;未提供在不同环境下的灵敏度分析。
此外,评估使用Qwen3.5-27B作为LLM-as-a-Judge和自一致性投票,虽然通过专家抽样进行了验证,但仍继承了评判模型自身的盲点。论文也未报告端到端延迟或计算成本,考虑到多智能体循环和每个诊断轮次中运行的CMR步骤,这些成本可能相当显著。
这对领域意味着什么
OpsMem进入了一个竞争激烈的领域。基于LLM的故障诊断已成为AI工程中最活跃的领域之一,ReAct、GoS、RCACopilot和FlowXpert等论文都提出了不同的架构。OpsMem的贡献在于为一个它们都未完全解决的问题提供了原则性的答案:如何在诊断本身改变状态的同时,保持诊断状态与操作知识库的相互对齐。
双记忆概念在认知科学中并不新鲜, , 它本质上是心理学家研究了几十年的工作记忆与长期记忆区别的计算实现。但将其应用于AI驱动的故障诊断,并辅以一个连接两者的具体共振机制,则是新颖的,并且实证结果足够强大,值得研究社区和大规模云服务提供商的运维团队认真关注。
代码和提示已公开在GitHub上,这应加速独立验证。目前,OpsMem是解决让AI诊断从它遇到的每一个故障中学习这一棘手问题的最有前景的近期方法之一。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。