← 返回 PaperDaily 大模型与智能体

三星SEKA-FT:让1.5B基础模型搞定5G根因诊断,准确率直冲94.2%

LLM做5G故障根因分析,最怕的就是一本正经地编证据。三星美研这次把“证据→诊断路径→结论”结构化地塞进微调过程,让1.5B小模型直接干出94.2%准确率。想研究LLM垂直落地与“反幻觉”设计的同学,这篇值得细读。

三星SEKA-FT:让1.5B基础模型搞定5G根因诊断,准确率直冲94.2%

paperdaily_reaction_gif


原论文信息如下:
论文标题:
Large Language Models (LLMs) for Telecom Root Cause Analysis (RCA): A Structured Reasoning Framework for Evidence-Grounded Diagnosis
发表日期:
2026年09月
发表单位:
三星美国研究院(Samsung Research America)
原文链接:
https://arxiv.org/pdf/2609.02805v1.pdf
先聊一个让运营商后背发凉的事实:2022年加拿大Rogers断网、2023年澳大利亚Optus大规模故障、2024年美国AT&T全网中断——这几起事故叠加起来,影响的设备超过一亿台,阻断的急救电话超过两万五千通,直接经济损失以亿美元计。每次事故之后,工程师面对的不是“没有告警”,而是告警太多、数据太杂,根本说不清“到底哪根链条先断的”。
这个“从一堆现象里揪出真正病根”的过程,在通信领域叫做RCA(Root Cause Analysis,根因分析)。放在5G甚至6G网络里,RCA的难度被成倍放大:一张基站既要管无线信号,又要跟核心网、传输网协同;用户速率突然下降,可能是天线倾角压得太低,可能是邻区切换太频繁,可能是物理资源块被占满,也可能是终端移动速度太快导致信号来不及交接。

电信网络故障诊断的智能化转型:从规则匹配到LLM推理

传统的电信RCA,走过两条很清晰的路线。第一条是规则专家系统:工程师把常见故障写成告警模板和KPI阈值,网络一出问题就按预先定义的逻辑去匹配。这种方法透明、确定,但本质上是“人工穷举故障模式”,场景一多、跨层耦合一深,规则库就变成沉重的负担。第二条是机器学习路线:用历史遥测数据训练模型来做异常检测和故障分类。ML方法能处理海量数据,但大多数仍然停留在“输入指标、输出标签”的统计映射层面,它不解释推理过程,也难应付没见过的故障组合。
图1:基于规则、机器学习与LLM赋能的RCA方法对比。
基于规则、机器学习与LLM赋能的RCA方法对比。
大语言模型(LLM,Large Language Model)之所以被寄予厚望,是因为它正好补上前面两条路线的短板:LLM能做多步推理,能同时理解无线接入网、传输网和核心网的跨域知识,还能输出人话解释自己的诊断依据。听起来,这简直就是为电信RCA量身定做的“会讲道理的诊断专家”。
然而,直接把一个“裸奔”的通用LLM扔到5G故障数据上,结果往往很尴尬。论文里总结出三大障碍:第一,推理不稳定,对相似的一批测量数据,模型可能这次说是资源调度问题,下次又说是切换问题;第二,结构化证据对齐缺失,KPI、信令日志、邻区关系、工程参数这些异构数据混在一起,模型很难严格区分哪些是因果证据、哪些只是表面相关;第三,幻觉频发,模型给出的解释听起来头头是道,实际却跟眼前的实测数据对不上。
这三大障碍不解决,LLM在电信RCA里就只能当个“聊天顾问”,没法当“定案专家”。而三星美国研究院这次拿出的SEKA-FT,目标就是把这串问题一次性按住。

SEKA-FT框架:如何让LLM在电信RCA中“按图索骥”

先交代一下SEKA-FT的全称:Structured Evidence- and Knowledge-Aligned Fine-Tuning,中文可以翻译为“结构化证据与知识对齐微调”。听名字就知道,它不是换了个更大的模型,而是把“如何使用证据”这件事直接写进微调目标里。
要把SEKA-FT放到一个更清晰的坐标系里,得先看一眼当前LLM赋能电信RCA的几种主流范式。论文用一张图做了很漂亮的总结。
图2:用于电信RCA的各种LLM赋能技术总结。
图2:用于电信RCA的各种LLM赋能技术总结。
从左到右分别是:CoT(Chain-of-Thought,思维链提示),它让模型把诊断逻辑拆成多步来走;RAG(Retrieval-Augmented Generation,检索增强生成),从3GPP规范、设备手册、历史工单里检索权威材料再作答;Agentic orchestration(智能体编排),让LLM调用外部工具、甚至驱动ns-3模拟器验证假设;RLVR(Reinforcement Learning with Verifiable Rewards,基于可验证奖励的强化学习),把“诊断动作做完后KPI是否真的恢复”作为奖励信号。这张图底部的箭头表明,LLM的推理能力从“模型内部组织”一步步走向“外部知识落地”和“物理环境闭环”。
SEKA-FT没有直接跳到Agent或RLVR这种重交互框架,而是先把最基础、也最要命的“诊断路径控制”做扎实。它的核心思想可以浓缩成一个链条:Evidence-to-Path-to-Decision,即“证据—路径—决策”。也就是说,RCA不能是“输入一段KPI、直接吐一个根因标签”的分类任务,而应该是“先看清楚证据、再按步骤排除假设、最后才给结论”的结构化推理任务。
图3:SEKA-FT整体框架概览。
图3:SEKA-FT整体框架概览(即原文Fig.4)。
从整体框架图可以看到,SEKA-FT的输入是各种异构的电信故障工单,包括用户面KPI、控制面日志、邻区关系、服务小区工程参数等。这些输入往往只附带一个稀疏的根因标签,比如一个孤零零的“M3”。如果拿这种原始数据直接微调小模型,模型大概率会去记“哪段文本对应哪个标签”的表面捷径,而不是真正理解故障机理。SEKA-FT的应对方式是三段式流水线:先把异构证据整理成规范上下文,再让模型生成中间诊断检查结果来收窄候选空间,最后用“证据锚定的解释+根因标签”作为完整输出目标。整条链路,本质上就是给模型画了一张“诊断地图”,不允许它跳步。

三层结构化设计:规范上下文、决策路径与证据锚定解释

SEKA-FT的三层设计,分别回答三个问题:模型看什么、按什么顺序想、如何开口解释。

第一层:规范上下文结构(Canonical Context Structuring)

实际电信环境里的RCA输入五花八门:工单是半自由文本,用户面指标是结构化表格,OSS系统日志是一长串时间戳。这些数据如果不加整理就直接喂给LLM,同样的诊断逻辑在不同样本里可能长得完全不一样,模型自然学不到稳定的推理轨迹。规范上下文结构要做的事情,就是把异构输入重新“排版”成一组固定语义槽位。论文中的样例将输入组织成几个区块:Bottleneck Snapshot(瓶颈快照,如下行吞吐量、服务小区SS-SINR)、UE Global State(UE全局状态,如最大UE移动速度)、Trajectory-Level Events(轨迹级事件,如总切换次数)、以及工程参数区(如机械下倾角、数字倾角、天线高度)。相同含义的指标永远出现在相同位置,与诊断无关的冗余日志则被剔除。
图4:SEKA-FT的一个输入输出样例。
图4:SEKA-FT的一个输入输出样例(即原文Fig.3)。
这个样例非常直观:下半部分是输入,上半部分是输出。输入里的机械下倾角被设置得很大,同时SS-SINR在下降;如果让模型直接报结论,它很可能顺手写一个“覆盖差”。但SEKA-FT要求的输出不是一步到位的结论,而是先给出一组中间检查结果:Speed_check、Low RB_check、Handover_check和Distance_check都判定为False,也就是说高速移动、资源饥饿、切换频繁、越区覆盖这四个常见假设全部被证据排除。模型这才把眼光聚焦到服务小区本身的工程参数上,最终给出根因M3——过量机械下倾角导致边缘覆盖损失。整个过程跟老专家排查故障的节奏几乎一致。

第二层:CoT决策路径控制(Decision-Path Control)

直接微调LLM去预测一个根因标签,问题在于单个标签包含的监督信息太少。模型不知道“应该先查什么、再排除什么”,于是很容易学到表面捷径。SEKA-FT把CoT从“提示技巧”升级成“监督机制”:模型必须先输出一组可验证的诊断检查结果,再基于检查结果收窄假设空间。论文在TeleLogs数据集上为这些检查定义了明确的判定规则,比如最大终端速度超过40km/h判定为高速移动,平均调度RB数低于160判定为资源不足。这些规则不是拍脑袋定出来的阈值,而是直接来自原始RCA故障定义。
这样做有一个很直接的好处:如果某一步检查发现了决定性异常(比如终端速度极高),那模型可以提前收敛结论,不用把后面所有假设都翻一遍。反过来,如果所有常规检查都被排除,模型就会把注意力集中到还没被检查的工程参数上。这种“先剪枝、再聚焦”的过程,把RCA从一次开卷考试变成了一场有流程的排查。

第三层:证据与知识锚定的解释设计(Evidence- and Knowledge-Anchored Explanation)

很多RCA数据集里只有“根因标签”这一项监督信号,这对教模型“如何选证据、如何排除假设”来说太稀疏了。SEKA-FT因此把解释设计成结构化的监督载体。从图4的样例可以看到,模型生成的解释严格分成两步:第一步,把高维遥测数据压缩成可验证的诊断检查;第二步,根据检查结果做知识引导的假设精炼,锚定到具体工程参数上。所有解释必须能“指回”可观测指标,不允许凭空编造。这样一来,模型要学的不是“哪个词配哪个标签”,而是“哪类证据能支撑哪条推理路径”。

实验验证:跨数据集的一致性能提升与统计显著性分析

再漂亮的设计也得拿数据说话。SEKA-FT的实验选择两个互补的5G RCA数据集:TeleLogs是与GSMA LLM基准倡议关联的电信专用数据集,样本包含结构化用户面KPI、移动性统计、服务小区工程参数和根因标签;TelecomTS则来自实验室部署的5G测试台,在高分辨率KPI上记录基站和终端的多通道时间序列观测。前者强调跨层联合推理,后者侧重真实测试台条件下的时序KPI诊断,组合起来可以检验框架是不是只在单一数据模板上有效。
基线设置也比较讲究。主模型是Qwen2.5-1.5B-Instruct,对比对象包括:普通ICL(In-Context Learning,上下文学习)、LSTM序列分类模型、Vanilla SFT(用原始输入输出直接做监督微调)、SFT+Structured Input(只做输入规范化)、SFT+Explanation(只加解释监督)以及完整的SEKA-FT。微调用LoRA(Low-Rank Adaptation,低秩适配)只更新最后四个Transformer块,训练12个epoch,batch size为2,最大序列长度2048,单卡RTX 6000 Ada即可跑完。
表1:TeleLogs与TelecomTS数据集上的综合实验结果。
表1:TeleLogs与TelecomTS数据集上的综合实验结果。
先看TeleLogs上的核心数字。Vanilla SFT的Accuracy只有0.007±0.003,Macro-F1为0.013±0.004,基本等同于随机乱猜;SFT+Explanation也只有0.030±0.005。这说明两件事:第一,小模型在原始异构文本上做直接标签映射,根本学不到有效规律;第二,单纯把解释文本塞进输出序列,但解释跟证据之间没有结构约束,也救不回来。SFT+Structured Input把成绩拉到0.256±0.018,说明规范上下文确实有用,但距离“可用”还差得远。
图5(a):不同训练策略的Accuracy与Macro-F1对比结果。
图5(a):不同训练策略的Accuracy与Macro-F1对比结果。
完整的SEKA-FT则直接冲到0.942±0.006 Accuracy和0.937±0.007 Macro-F1。相比之下,LSTM基线只有0.132±0.012 Accuracy,普通ICL的1.5B模型只有0.021±0.004。这个差距清晰说明:在复杂跨域RCA任务里,传统序列模型还是结构化的LLM推理方案,差距是数量级的,不是几个百分点的“微调”。
图5(b):随训练epoch变化的收敛动态对比。
图5(b):随训练epoch变化的收敛动态对比。
收敛曲线同样很有说服力:Vanilla SFT和SFT+Explanation全程贴着地板,几乎没有有效学习;SFT+Structured Input能稳定上升但很快饱和;SEKA-FT则快速爬升并保持在最高水位。这说明结构化监督不仅提升了最终成绩,还改善了训练效率和稳定性。
图5(c):Qwen2.5-1.5B、7B与32B模型的ICL性能对比。
图5(c):Qwen2.5-1.5B、7B与32B模型的ICL性能对比。
更有意思的是模型规模实验。论文把Qwen3-32B拉出来做纯ICL,结果最高也只有0.126±0.010 Accuracy。1.5B的SEKA-FT以不到二十分之一的参数量,把32B大模型的ICL成绩远远甩在身后。这个对比非常解气:对于电信RCA这种需要严格证据对齐的任务,模型大小解决不了“不会用证据”的问题,把推理路径结构化才是更有效的杠杆。
图5(d):RCA决策路径一致性准确率对比。
图5(d):RCA决策路径一致性准确率对比。
光有最终答案对了还不够,RCA更需要“过程可靠”。图5(d)检查了模型在过覆盖、频繁切换、高速移动、资源块不足这几项关键诊断检查上是否保持一致。Vanilla SFT和SFT+Explanation的检查一致性低得可怜,说明它们即便偶尔猜对标签,中间逻辑也是乱的。SEKA-FT在所有检查项上接近满分,证明它学到的是稳定的诊断逻辑,而不是碰巧蒙对答案。
图5(e):各类根因的准确率分析。
图5(e):各类根因的准确率分析。
图5(e)进一步分析了不同根因类别的难度分布。C2和C8几乎被完美分类,C5和C7也有很高准确率;剩余的少数错误集中出现在覆盖和邻区相关的类别。这类故障本身在电信语义里就高度容易混淆——过大的下倾角、邻区选择过强、覆盖交叠,都会产生相似的RSRP/SINR和邻区关系图谱。也就是说,SEKA-FT剩下的错误不是随机乱猜,而是集中在人类专家也会犯难的模糊边界上,这个残差分布非常“像个正经诊断系统”。
图5(f):通过顺序诊断检查实现的RCA候选空间缩减。
图5(f):通过顺序诊断检查实现的RCA候选空间缩减。
图5(f)用树形剪枝图展示了候选根因空间如何一步步缩小:从完整的假设集合,到被逐步排除掉不合适的分支,最后只留下有证据支持的少数候选。这正是SEKA-FT“决策路径控制”的可视化注脚——模型在到达最终结论之前,已经系统性地关掉了大量错误路径。
如果SEKA-FT只在TeleLogs上灵,那还可能是过拟合了某一套数据模板。论文的第二组实验把同样的框架搬到TelecomTS上,这是一套来自实验室5G测试台的多通道时序观测数据,证据表示和诊断特征跟TeleLogs完全不同。实验结果显示,SEKA-FT在这第二个数据集上同样取得了稳定且一致的性能提升。跨数据集的复现,比任何单点SOTA都更能说明结构化推理设计的可迁移性。
统计严谨性方面,论文也做得相当到位:全部结果在十个不同随机种子下重复运行,报告95%置信区间;显著性检验用精确McNemar检验处理Accuracy,用配对置换检验处理Macro-F1,多组对比时再用Holm–Bonferroni校正。这一套组合拳下来,SEKA-FT的优势不太可能是“随机种子运气好”带来的。

局限与展望:从5G RAN到更广泛的电信故障诊断场景

SEKA-FT交出的答卷相当漂亮,但它也有清晰的能力边界。第一,两个评测数据集都集中在5G无线接入网(RAN,Radio Access Network)的吞吐量下降和可观测性场景,核心网故障、传输网劣化、端到端切片异常等更广阔的故障域还没有覆盖。第二,诊断检查项和知识规则需要专家针对具体场景梳理,换一个网络域,这些“下游关卡”就得重新设计,不能说一个模型通吃所有RCA。第三,解释部分带有工程模板的痕迹,在训练分布以外的罕见故障上,模型的开放解释能力可能没那么稳。第四,SEKA-FT目前还停留在“静态训练+离线推理”,没有接入Agent那样的环境交互闭环,也无法像RLVR那样根据实际操作结果持续进化。
未来的演进路径其实论文已经画出来了:SEKA-FT把“结构化推理”这项地基打好之后,可以自然地叠加RAG把3GPP规范和厂商工单拉进决策上下文,再叠加Agentic能力让模型去调用网管工具验证假设,最后用RLVR把“诊断后KPI是否改善”变成奖励信号。到那个阶段,电信RCA有望从“会讲理的诊断建议系统”,进化成“能动手、能验证、能担责的自治网络运维智能体”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?5G网络故障排查复杂且易错。三星美研提出SEKA-FT,用“证据—诊断路径—结论”结构化微调约束LLM推理,减少幻觉。在TeleLogs数据集上准确率达0.942、F1达0.937,在TelecomTS数据集上也显著超越多种基线和
这篇工作最值得看的点是什么?SEKA-FT在TeleLogs上达到0.942±0.006 Accuracy和0.937±0.007 Macro-F1,在TelecomTS上达到0.647±0.004 Accuracy和0.615±0.005 Macro-F1,均显著优于所有基线方法
这篇工作的边界或风险在哪里?优点:1)提出统一的证据-路径-决策监督结构,有效解决LLM在电信RCA中的幻觉和不稳定推理问题;2)跨数据集验证了框架的泛化性;3)消融实验设计清晰,逐步验证各组件贡献。缺点:1)在TelecomTS上的绝对性能仍有提升空间(0.647 Accuracy);2)依赖领域知识构建诊断检查和解释模板,需要专家参与;3)未在真实运营商故障场景中验证。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出SEKA-FT框架,通过将异构网络证据规范化为标准上下文、引入决策路径推理和证据锚定解释,将电信RCA从直接标签预测转变为结构化推理过程。

实验合理度:★★★★☆

Accuracy和Macro-F1,采用95%置信区间,使用精确McNemar检验和配对置换检验进行统计显著性分析

学术研究价值:★★★★☆

提出SEKA-FT框架,通过将异构网络证据规范化为标准上下文、引入决策路径推理和证据锚定解释,将电信RCA从直接标签预测转变为结构化推理过程;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

使用Nvidia RTX 6000 Ada GPU,batch size为2,最大序列长度2048,训练12个epoch,采用bf16混合精度。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;2)跨数据集验证了框架的泛化性;3)消融实验设计清晰,逐步验证各组件贡献。缺点:1)在TelecomTS上的绝对性能仍有提升空间(0.647 Accuracy);2)依赖领域知识构建诊断检查和解释模板,需要专家参与;3)未在真实运营商故障场景中验证。

主要参考文献

[1] 2022年Rogers断网、2023年Optus大规模故障、2024年AT&T网络中断相关报道与损失统计。
[8] TeleLogs: A telecom-specific benchmark associated with the GSMA LLM benchmarks initiative.
[11] Wei J., et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS, 2022.
[12] Lewis P., et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS, 2020.
[13] Schick T., et al. Toolformer: Language Models Can Teach Themselves to Use Tools. NeurIPS, 2023.
[15] TelecomTS: 5G observability dataset derived from a lab-deployed testbed with high-resolution KPI records.
[16] Zhou H., et al. Large Language Models (LLMs) for Telecom Root Cause Analysis (RCA): A Structured Reasoning Framework for Evidence-Grounded Diagnosis. arXiv:2609.02805, 2026.

融会贯通

把SEKA-FT放进龙哥已收录的RCA相关论文里横向观察,可以清晰看到一条正在成形的行业共识:电信故障诊断正在从“堆模型规模”转向“约束推理结构”。SEKA-FT在TeleLogs上把1.5B小模型的Accuracy推到0.94以上,说明与其花大力气部署一个32B甚至更大的模型,不如先把手头的小模型“调教”得会按流程办事。这个判断对算力有限的运营商场景尤其有参考意义。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球