论文标题:
Large Language Models (LLMs) for Telecom Root Cause Analysis (RCA): A Structured Reasoning Framework for Evidence-Grounded Diagnosis
发表日期: 2026年09月发表单位: 三星美国研究院(Samsung Research America)原文链接: https://arxiv.org/pdf/2609.02805v1.pdf
先聊一个让运营商后背发凉的事实:2022年加拿大Rogers断网、2023年澳大利亚Optus大规模故障、2024年美国AT&T全网中断——这几起事故叠加起来,影响的设备超过一亿台,阻断的急救电话超过两万五千通,直接经济损失以亿美元计。每次事故之后,工程师面对的不是“没有告警”,而是告警太多、数据太杂,根本说不清“到底哪根链条先断的”。这个“从一堆现象里揪出真正病根”的过程,在通信领域叫做RCA(Root Cause Analysis,根因分析)。放在5G甚至6G网络里,RCA的难度被成倍放大:一张基站既要管无线信号,又要跟核心网、传输网协同;用户速率突然下降,可能是天线倾角压得太低,可能是邻区切换太频繁,可能是物理资源块被占满,也可能是终端移动速度太快导致信号来不及交接。
电信网络故障诊断的智能化转型:从规则匹配到LLM推理
传统的电信RCA,走过两条很清晰的路线。第一条是规则专家系统:工程师把常见故障写成告警模板和KPI阈值,网络一出问题就按预先定义的逻辑去匹配。这种方法透明、确定,但本质上是“人工穷举故障模式”,场景一多、跨层耦合一深,规则库就变成沉重的负担。第二条是机器学习路线:用历史遥测数据训练模型来做异常检测和故障分类。ML方法能处理海量数据,但大多数仍然停留在“输入指标、输出标签”的统计映射层面,它不解释推理过程,也难应付没见过的故障组合。基于规则、机器学习与LLM赋能的RCA方法对比。大语言模型(LLM,Large Language Model)之所以被寄予厚望,是因为它正好补上前面两条路线的短板:LLM能做多步推理,能同时理解无线接入网、传输网和核心网的跨域知识,还能输出人话解释自己的诊断依据。听起来,这简直就是为电信RCA量身定做的“会讲道理的诊断专家”。然而,直接把一个“裸奔”的通用LLM扔到5G故障数据上,结果往往很尴尬。论文里总结出三大障碍:第一,推理不稳定,对相似的一批测量数据,模型可能这次说是资源调度问题,下次又说是切换问题;第二,结构化证据对齐缺失,KPI、信令日志、邻区关系、工程参数这些异构数据混在一起,模型很难严格区分哪些是因果证据、哪些只是表面相关;第三,幻觉频发,模型给出的解释听起来头头是道,实际却跟眼前的实测数据对不上。这三大障碍不解决,LLM在电信RCA里就只能当个“聊天顾问”,没法当“定案专家”。而三星美国研究院这次拿出的SEKA-FT,目标就是把这串问题一次性按住。
SEKA-FT框架:如何让LLM在电信RCA中“按图索骥”
先交代一下SEKA-FT的全称:Structured Evidence- and Knowledge-Aligned Fine-Tuning,中文可以翻译为“结构化证据与知识对齐微调”。听名字就知道,它不是换了个更大的模型,而是把“如何使用证据”这件事直接写进微调目标里。要把SEKA-FT放到一个更清晰的坐标系里,得先看一眼当前LLM赋能电信RCA的几种主流范式。论文用一张图做了很漂亮的总结。图2:用于电信RCA的各种LLM赋能技术总结。从左到右分别是:CoT(Chain-of-Thought,思维链提示),它让模型把诊断逻辑拆成多步来走;RAG(Retrieval-Augmented Generation,检索增强生成),从3GPP规范、设备手册、历史工单里检索权威材料再作答;Agentic orchestration(智能体编排),让LLM调用外部工具、甚至驱动ns-3模拟器验证假设;RLVR(Reinforcement Learning with Verifiable Rewards,基于可验证奖励的强化学习),把“诊断动作做完后KPI是否真的恢复”作为奖励信号。这张图底部的箭头表明,LLM的推理能力从“模型内部组织”一步步走向“外部知识落地”和“物理环境闭环”。SEKA-FT没有直接跳到Agent或RLVR这种重交互框架,而是先把最基础、也最要命的“诊断路径控制”做扎实。它的核心思想可以浓缩成一个链条:Evidence-to-Path-to-Decision,即“证据—路径—决策”。也就是说,RCA不能是“输入一段KPI、直接吐一个根因标签”的分类任务,而应该是“先看清楚证据、再按步骤排除假设、最后才给结论”的结构化推理任务。图3:SEKA-FT整体框架概览(即原文Fig.4)。从整体框架图可以看到,SEKA-FT的输入是各种异构的电信故障工单,包括用户面KPI、控制面日志、邻区关系、服务小区工程参数等。这些输入往往只附带一个稀疏的根因标签,比如一个孤零零的“M3”。如果拿这种原始数据直接微调小模型,模型大概率会去记“哪段文本对应哪个标签”的表面捷径,而不是真正理解故障机理。SEKA-FT的应对方式是三段式流水线:先把异构证据整理成规范上下文,再让模型生成中间诊断检查结果来收窄候选空间,最后用“证据锚定的解释+根因标签”作为完整输出目标。整条链路,本质上就是给模型画了一张“诊断地图”,不允许它跳步。
三层结构化设计:规范上下文、决策路径与证据锚定解释
SEKA-FT的三层设计,分别回答三个问题:模型看什么、按什么顺序想、如何开口解释。
第一层:规范上下文结构(Canonical Context Structuring)
实际电信环境里的RCA输入五花八门:工单是半自由文本,用户面指标是结构化表格,OSS系统日志是一长串时间戳。这些数据如果不加整理就直接喂给LLM,同样的诊断逻辑在不同样本里可能长得完全不一样,模型自然学不到稳定的推理轨迹。规范上下文结构要做的事情,就是把异构输入重新“排版”成一组固定语义槽位。论文中的样例将输入组织成几个区块:Bottleneck Snapshot(瓶颈快照,如下行吞吐量、服务小区SS-SINR)、UE Global State(UE全局状态,如最大UE移动速度)、Trajectory-Level Events(轨迹级事件,如总切换次数)、以及工程参数区(如机械下倾角、数字倾角、天线高度)。相同含义的指标永远出现在相同位置,与诊断无关的冗余日志则被剔除。图4:SEKA-FT的一个输入输出样例(即原文Fig.3)。这个样例非常直观:下半部分是输入,上半部分是输出。输入里的机械下倾角被设置得很大,同时SS-SINR在下降;如果让模型直接报结论,它很可能顺手写一个“覆盖差”。但SEKA-FT要求的输出不是一步到位的结论,而是先给出一组中间检查结果:Speed_check、Low RB_check、Handover_check和Distance_check都判定为False,也就是说高速移动、资源饥饿、切换频繁、越区覆盖这四个常见假设全部被证据排除。模型这才把眼光聚焦到服务小区本身的工程参数上,最终给出根因M3——过量机械下倾角导致边缘覆盖损失。整个过程跟老专家排查故障的节奏几乎一致。
[1] 2022年Rogers断网、2023年Optus大规模故障、2024年AT&T网络中断相关报道与损失统计。[8] TeleLogs: A telecom-specific benchmark associated with the GSMA LLM benchmarks initiative.[11] Wei J., et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS, 2022.[12] Lewis P., et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS, 2020.[13] Schick T., et al. Toolformer: Language Models Can Teach Themselves to Use Tools. NeurIPS, 2023.[15] TelecomTS: 5G observability dataset derived from a lab-deployed testbed with high-resolution KPI records.[16] Zhou H., et al. Large Language Models (LLMs) for Telecom Root Cause Analysis (RCA): A Structured Reasoning Framework for Evidence-Grounded Diagnosis. arXiv:2609.02805, 2026.