摘要
可观测性工程师中有越来越多的人认为,大语言模型的推理能力已经不再是 AI 辅助根因分析的瓶颈。当前更棘手的问题在于决定哪些数据能传入模型的处理流程。对于将大语言模型应用于事件响应的团队而言,他们从实践中得出的一个启示是:投入精力准备上下文信息,其回报可能比追求更强大的模型更为可观。大多数 AI 根因分析(RCA)工作可以分为两大类。基于代理的设计会向模型提供工具,让其自行展开调查,并在推理过程中自主选择要获取哪些遥测数据。确定性设计则会在前期就建立起信号间的关联,并向模型提供一个预先准备好的上下文。Coroot 的工作反映出,业界普遍正朝着第二种范式转变:Dynatrace 的 Davis AI" 也是依赖于确定性的、基于拓扑结构的因果分析,通过遍历实时依赖关系图来精准定位根本原因,而非让大语言模型(LLM)在开放式的代理循环中自由运行。这两种方法的故障表现形式各不相同,这使得难以判断诊断失败是源于推理能力不足,还是源于向模型提供了错误证据的治理框架。可观测性供应商 Coroot 的最新研究试图将这两个变量区分开来。在其原创研究"中,工程师 Nikolay Sivko 将借助大语言模型(LLM)进行根因分析(RCA)的过程拆分为两项任务:对当前呈现的数据进行推理,以及决定哪些数据以何种形式传入模型的“数据采集框架”。他认为,“AI 能否进行根因分析?”这个问题本身就是错误的,因为这两项任务需要分别进行评估。Coroot 的处理流程将信号关联成调查结果,并在不涉及代理循环的情况下,以单一聚焦的上下文形式将这些结果传递给大模型,这样就可以将错误答案归因于模型本身,而非证据缺失。为了验证这一机制,Sivko 构建了一个场景:通过 Chaos Mesh NetworkChaos" 实验在目录服务与其 Postgres 数据库之间注入延迟,从而减慢查询速度并导致前端出现 502 错误。该场景特意包含了一些误导性信号,例如因网络往返时间而被夸大的查询时长。随后,他向十一款模型输入了相同的提示(约 9800 个令牌),要求每款模型分别给出根本原因、因果链以及即时修复方案。前沿专有模型 Claude Opus 4.8、GPT-5.5 和 Gemini 3.1 Pro 均通过了测试,不仅给出了实验名称,还指出需要删除该实验及其定时任务。更大的开放权重模型大多表现不俗。
相关事件
暂无数据
相关公司
暂无数据
相关人物
暂无数据