← 返回 PaperDaily 视觉与图像

高棉语OCR新范式!一个模型同时搞定识别和分词,延迟大幅降低

高棉语这种低资源小语种,连词与词之间都没有空格,OCR完还得单独做分词。这篇论文直接端到端二合一,一个CTC解码器同时吐字符和词边界,合并任务延迟大幅下降,精度还不掉队。低资源语言NLP的工程落地,值得一看。

高棉语OCR新范式!一个模型同时搞定识别和分词,延迟大幅降低

paperdaily_reaction_gif


原论文信息如下:
论文标题:
Towards a Joint Khmer Text Recognition and Word Segmentation
发表日期:
2026年08月

发表单位:
Techo Startup Center(柬埔寨经济与财政部)、大阪公立大学

原文链接:
https://arxiv.org/pdf/2608.30213v1.pdf

开源数据集链接:
论文中提到新生成的带词边界标注的数据集将开放(见论文脚注3)

开源代码链接:
论文未提供

高棉语识别的痛点:两阶段流水线的困境

先来聊一个很多非语言学背景的同学可能完全没意识到的冷知识:世界上并不是所有语言都在词与词之间打空格的。
中文虽然不分词,但好歹每个汉字是独立的方块字,边界肉眼可见;而高棉语(Khmer)比中文还要“狠”一些——它连字符都没有明显的边界。高棉文字符天然堆叠成复杂的多层结构,辅音、元音、变音符号层层嵌套,词与词之间完全没有任何可见的切分标记。你拿到一段高棉语文本,就像拿到一条被压缩过的连续字节流,如果没有语言学知识,根本拆不开哪里是词头、哪里是词尾。
图1:高棉语文本的多层布局示意图
高棉语文本的多层布局示意图,展示了复杂的字符堆叠和连写结构。绿色:基础辅音;蓝色:下加辅音;橙色:依附元音;紫色:变音符号。
这就带来一个非常现实的工程问题。今天任何一套知识检索系统(比如目前大火的RAG,即检索增强生成,Retrieval-Augmented Generation),第一步都是要把文档图片变成电子文本。对于高棉语来说,OCR(光学字符识别,Optical Character Recognition)把图片转成文字之后,还不能直接拿去建索引——因为高棉语没有空格,你没法直接把句子切成词给倒排索引用,也没法做拼写检查和词性标注。
所以过去的高棉语文档处理流程是这样的:先用一个OCR模型把图片里的文字识别出来;然后把这个识别结果喂给另一个独立的分词模型,让它去把没有空格的文本切成词。一前一后,两个模型串行跑,像流水线上的两道工序。
这套两阶段流水线听起来好像也没啥大问题?但实际跑起来就难受了。首先,OCR模型输出的是带噪声的预测序列,如果OCR本身识别错了一个字符,下游分词模型根本不知道这个错误是真实的字符还是OCR的误判,只能硬着头皮在前序错误的基础上继续切分,错误就这样一级一级地向下游传导放大。其次,工业场景里往往要批量处理几十万页文档,每个文档都要跑两遍模型,一遍识别一遍分词,推理耗时直接翻倍,吞吐量上不去,机器成本也跟着水涨船高。
这篇文章的切入点就在这:为什么不能把两个任务塞进同一个模型,让模型在识别字符的同时顺便把词边界给标出来?这样一来,延迟减半,错误传导也被掐断在源头。
他们的回答是:能,而且效果还不错。

一石二鸟:KTRWS如何实现联合识别与分割

这篇论文提出的方法名叫KTRWS,全称是Joint Khmer Text Recognition and Word Segmentation,即“联合高棉语文字识别与分词”。看这个命名就知道,他们的目标很明确:在一个模型里同时完成文字识别和分词两件事,把原来串行的两阶段流程合并成一个端到端的整体。
要理解这个框架,先得弄清楚一个关键点:词边界标记(word boundary marker)。这个标记在论文里用Unicode字符u200b表示,它是一个零宽空格,也就是在视觉上看不见、但存在于文本数据流中的一个特殊符号。如果把高棉语文本比作一串没有间隔的“冰糖葫芦”,词边界标记就是插入在“葫芦”之间的“竹签”——肉眼看不清,但程序一读就知道哪里该断。
KTRWS把“是否输出词边界”做成了一个可配置项,用一个二值变量b来控制:当b=1时,模型在输出字符序列的同时额外插入u200b标记来指示词边界;当b=0时,模型就只输出纯字符序列。这意味着,同样一个模型权重,既可以当普通OCR用,也可以当“OCR+分词”二合一神器用,完全看下游任务的需求。
图2:KTRWS整体框架图
图2:KTRWS整体框架图。整个框架由词边界投影模块、视觉编码器、模态感知特征选择模块(MAFS)和CTC文本解码器四部分组成。
图2展示了KTRWS的整体架构。整个框架由四个核心组件构成:词边界投影模块(Word Boundary Projector)、视觉编码器(Visual Encoder)、模态感知特征选择器(Modality-Aware Feature Selector,简称MAFS)、以及CTC文本解码器(CTC Decoder)。
这里先解释一下CTC是什么。CTC全称Connectionist Temporal Classification,是语音识别和文字识别领域一个经典的对齐算法,2006年由Alex Graves等人提出。它的核心思想是:模型不需要知道每个输出字符精确对应图像的哪个位置,只需要在整条时间序列上预测一系列字符分布,最后通过动态规划把所有可能的对齐路径合并成一条最可能的输出序列。CTC解码器最大的优势就是“快”,它是并行解码,不像自回归模型那样一个字符一个字符地往外蹦,所以在工业界OCR中应用非常广泛。
这里还要补充一个背景知识:高棉语文本的tokenization方案(即如何把文本拆成模型处理的基本单元)。早期的高棉语OCR方法都是按照字符级别进行tokenize,也就是把一个一个的独立字符作为识别单元。但这篇文章采用的是[2,13]中提出的高棉语字符簇(Khmer Character Cluster,简称KCC)方案。什么是字符簇?简单说就是把高棉语中经常堆叠在一起的一组字符(比如基础辅音+下加辅音+依附元音)打包成一个整体作为最小识别单元。用字符簇代替单字符,可以显著降低OCR的字符错误率,因为模型不需要去逐字拆解那些堆叠的结构,而是整体识别。

技术拆解:词边界投影与模态感知特征选择

这套框架里最有意思的设计,是那个把“是否输出词边界”这个指令注入到视觉特征里的词边界投影模块(Word Boundary Projector Module)。
这个模块做的事情非常直白。首先把b这个二值变量(0或1)通过一个嵌入层变成一个向量,然后再用两个独立的线性层分别映射成两个向量β和γ。这里的β和γ扮演的是类似“特征缩放”和“特征平移”的角色,它们会被作用到视觉特征上,从而告诉模型:这次推理需不需要额外地输出词边界标记。你可以把这个过程想象成一个“可插拔的外部指令”:用户想要词边界,就把b拨到1,模型自动调整特征分布,倾向于吐出带u200b的输出;不想要,就把b拨到0,模型就跑成普通OCR。
公式:词边界嵌入 公式:β投影 公式:γ投影
公式1-3:词边界投影模块的数学表达。首先将二值变量b通过嵌入层变为向量E_b,再分别通过两个线性层得到向量β和γ。其中β用于特征平移,γ用于特征缩放。
这种通过缩放和平移来调整特征的手段,其实是借鉴了计算机视觉里非常经典的特征线性调制(Feature-wise Linear Modulation,简称FiLM)思想。FiLM最早是在视觉问答任务中被提出来的:用一个条件向量对特征图做逐通道的缩放和平移,从而让模型在不同的问题条件下产生不同的特征响应。在这篇文章里,FiLM被用来做“词边界条件控制”。论文还对比了另一种更简单的门控融合(Gating)方案,实验证明FiLM的效果要优于门控方案。
说完词边界投影模块,再看视觉编码器。视觉编码器由两部分组成:底层的CNN(卷积神经网络,Convolutional Neural Network)负责提取二维视觉特征,然后经过一个基于Transformer的编码器进一步提取序列特征。为什么要用Transformer?因为高棉语文本的字符堆叠结构非常复杂,底层的字符与上层的变音符号之间存在长距离的依赖关系,纯CNN的局部感受野很难捕捉到这种全局的上下文依赖。Transformer的self-attention天然适合建模这种长距离依赖。
公式:CNN特征提取 公式:Transformer编码 公式:高度方向平均池化
公式4-6:视觉编码器的特征提取过程。输入图像I先经过CNN得到二维特征F,再经过Transformer编码器得到序列特征G,最后在高度方向进行平均池化得到一维序列特征G₁D,方便后续送入CTC解码器。
接下来是模态感知特征选择器(MAFS)。这是从论文[13]中借鉴并改进的一个模块。为什么要设计这个模块?因为高棉语OCR要面对的图片模态差异非常大:印刷体文档(document)、自然场景拍摄的招牌广告(scene)、手写笔记(handwritten)——这三种图片的视觉特征分布天差地别。一个只在印刷体上训练过的模型,直接拿去识别手写体,效果大概率会崩。MAFS的思路是:不要用一套固定的特征提取参数硬扛所有模态,而是准备n个不同的“特征适配器”,每个适配器负责一种模态风格,然后根据输入图片的特征动态地决定应该更多地参考哪个适配器的输出。
公式:全局平均池化 公式:路由器计算分布 公式:适配器特征变换 公式:基于FiLM的特征融合
公式7-10:MAFS模块的数学表达。首先对一维特征G₁D做全局平均池化得到向量z,然后ROUTER网络根据z计算出一个在n个模态源上的概率分布r,各ADAPTER基于G₁D分别生成适配特征H₁D,最后加权求和并通过γ和β做FiLM调制,得到最终输入CTC解码器的特征U₁D。
论文在MAFS中做的关键改进是:在原本的MAFS基础上把词边界的投影向量(β和γ)也融入进来,通过FiLM调制的方式作用到融合后的特征上。这样一来,词边界的“开关”信息和模态信息在同一个特征空间里被联合处理,模型能够在识别高棉语字符的同时一路贯通地决定是否输出词边界标记。
最后的文本解码器就是前面提到过的CTC解码器。模型对特征序列U₁D的每一帧都做一个softmax分类,分类的候选集是V′ = V ∪ {∅} ∪ {u200b},其中V是KCC字符簇的token集合,∅是CTC的空白符号(blank),u200b就是词边界标记。也就是说,解码器在每一帧上不仅要决定输出哪个字符簇,还可以输出“空白”或者“词边界”,这样就非常自然地实现了字符识别和词边界预测的统一。
公式:softmax分类 公式:CTC损失函数
公式11和14:CTC解码器的核心原理。公式11对特征每一帧做softmax得到字符分布pᵢ,公式14是在整个训练集上对所有可能的对齐路径求边际概率后计算CTC损失。
这里需要稍微展开讲一下CTC的“空白符号”到底是怎么回事。在CTC框架中,模型输出的序列长度(也就是帧数)通常远大于真实的字符序列长度,每一帧都要吐一个token,但不可能每一帧都对应一个真实的字符。所以CTC引入了空白符号∅来填充那些不输出字符的时间帧。在解码的时候,先按帧取概率最大的token,然后把连续的重复token合并,最后去掉所有空白符号,就得到了最终的输出序列。这样一来,模型不需要预先知道每个字符精确对齐到哪一帧,只需要保证整条序列的排列顺序是对的就行。
在测试阶段,KTRWS采用的是贪心解码(greedy decoding),也就是每一帧独立取概率最大的token,然后做合并和去空白操作。这个操作是纯并行的,不需要一个一个地迭代生成,因此推理速度非常快。
论文中还讨论了另一个有意思的细节:由于CTC解码是逐帧输出概率的,词边界标记u200b在输出的特征序列中也对应着特定的“帧位置”。因此,如果你把输出u200b的那一帧的位置映射回输入图像上,你就能看到这个词边界在原始图片中大概落在哪个位置。这就是论文中提到的“预测词的可视化定位能力”(visual grounding)——不仅知道哪些字符组成了一个词,还能在图片上框出这个词的物理范围。这个能力对于文档版面分析、关键信息抽取等下游任务来说,是一个非常有价值的副产品。

实验验证:精度与速度的双重突破

再好的设计也得用实验数据说话。论文的实验设置比较良心,覆盖了三种模态、多个公开数据集,还专门构造了一个带词边界标注的新数据集。
图3:现有数据集的部分样例预览图
图3:现有数据集的部分样例预览图,包含印刷体文档、自然场景文本和手写文本三类模态。
先看数据。论文使用的数据集还挺丰富:Buoy et al.提供了280万条合成文本行(含印刷体和场景文本);KHOB是1318条从低分辨率PDF文档中裁剪的真实文本行;SynthText有7万条从合成身份证图片中提取的文本行;HierText是51.8万条拉丁文印刷体/手写体文本行;KhmerST有3022条真实高棉语场景文本;WildKhmerST有29601条来自柬埔寨各地的真实场景文本;KH有约4200条高棉语和拉丁语手写/印刷文本行;GKST有4221条手机拍摄的高棉语场景文本;KHT有14168条高棉语手写文本图像。
表1:数据集信息汇总
表1:数据集信息汇总。Size表示训练/评估数量;Purpose表示用途(Tr=训练,Ad=适配,Ev=评估);Modality表示模态类型(D=文档,S=场景,H=手写)。
有一个细节值得注意:目前所有公开的高棉语文字识别数据集都没有词边界标注。为了解决这个问题,论文自己生成了一份带词边界标注的新数据集。具体做法是:先用Chea et al.提供的人工标注数据训练一个Transformer分词模型,然后用这个模型给新闻文章切分好词,在词之间插入u200b标记,再把这些带标记的文本渲染成图片。这样得到的图片在视觉上跟普通文本图片没有任何区别(因为u200b本来就是零宽的),但训练标签里包含了词边界信息。论文最终生成了6万张带标注的文本行图片。
图4:新数据集中的样例图片(带词边界标注)
图4:新生成的带词边界标注(红色竖条)的文本行图片样例。图(c)的英文翻译为“冲突的蔓延”。
模型的规模也不大,整个视觉编码器加起来才23M参数左右(ResNet主干13.0M + Transformer编码器9.5M + MAFS 0.8M),在32×116像素的输入上计算量大约5.6G FLOPs。这个体量在深度学习模型里算是非常轻量级的了。
表2:视觉编码器的参数量和计算复杂度
表2:视觉编码器的参数量和计算复杂度。Params表示模型参数量,FLOPs表示在32×116像素输入下的浮点运算量。
训练策略采用的是两阶段训练:第一阶段先在280万+70万+51.8万的合成印刷体大数据集上做通用训练,让模型学会高棉语和拉丁语字符的基本视觉表征;第二阶段再在真实的场景文本和手写文本数据集上进行模态适配训练,同时混入等量的文档图片来防止模型在印刷体上的性能退化。
识别精度方面,论文用字符错误率(CER,Character Error Rate)作为评价指标。CER越低越好,0%表示完美识别。下面是KTRWS与现有SOTA(即State-of-the-Art,目前最优方法)模型在不同模态数据集上的CER对比。
表3:不同模态评估数据集上的字符错误率对比
表3:不同模态评估数据集(D=文档,S=场景,H=手写)上的字符错误率对比。*表示使用模型专属的tokenizer;Seg.表示联合字符识别与分词。加粗表示最优,斜体表示次优。
看表3的数据。KTRWS在b=0模式下(即不输出词边界、纯识别),在KHOB(印刷体文档)上取得了1.75%的CER,对比SOTA的UKTR模型(论文[13])的2.46%有了明显下降,降幅约29%。在KhmerST(场景文本)上从3.02%降到2.77%,在KH(文档+手写混合)上从5.89%降到5.78%,在KHT(手写体)上从9.52%降到8.91%。只有在GKST(手机拍摄场景文本)上出现了轻微上升,从4.41%涨到4.51%,属于正常波动。整体来看,KTRWS在5个评估数据集中的4个上实现了CER下降。
那b=1模式下(即同时输出词边界)的识别精度会掉多少?在KHOB上从1.75%微涨到1.79%,几乎可以忽略不计;在KhmerST上从2.77%涨到3.04%;在KH上从5.78%涨到6.06%;在KHT上从8.91%涨到9.64%。整体看大约有一两个百分点的轻微回升,这是一个可以接受的代价——毕竟模型在同样的参数空间里多承担了一个分词任务,而且从后续的分词F1分数来看,这个代价换来的收益是值得的。
更关键的是速度提升。论文在KHOB评估集上对比了KTRWS(b=1)联合解码和“UKTR/KTRWS(b=0)识别→独立分词模型”串联流水线的整体延迟。
图5:KHOB评估集上联合识别与分割任务的延迟对比
图5:KHOB评估集上联合识别与分割任务的总延迟(秒)对比。KTRWS(b=1)的联合解码显著低于识别后再分词的串联流水线。
可以看到,KTRWS(b=1)把整个“识别+分词”流程压缩到了一个模型里,延迟远远低于先识别后分词的串联方案——因为完全省掉了独立分词模型的前向推理时间。论文也坦白指出,延迟的降低幅度跟你所使用的分词模型本身的耗时成正比:如果你在串联方案里用的分词模型非常快,那联合模型的优势就没那么显著;但如果你像他们实验中那样用Transformer分词器(计算量相对较大),联合模型的延迟优势就非常可观了。
分词质量方面,论文采用F1分数作为评价指标。F1是精确率(Precision)和召回率(Recall)的调和平均,同时考量“切出来的词对不对”和“有没有漏切或误切”,满分100%。
表4:不同模态评估数据集上的分词F1分数
表4:不同模态评估数据集上的分词F1分数。F1分数越高表示分词越准确。
在印刷体文档(KHOB)上,KTRWS(b=1)的分词F1达到了97.68%,相当优秀;在KhmerST(场景文本)上为95.08%;在KH(文档+手写)上为91.09%;在GKST(手机场景)上为93.35%;在KHT(手写体)上为89.24%。可以看到一个明显的趋势:模态越“规整”(印刷体),分词越准;模态越“野”(手写、艺术字体),分词越容易出错。这一点也符合直觉——手写文本和高难度场景文本的识别本身就更难,识别错了,分词自然跟着错。
论文还做了一组消融实验,对比了词边界投影模块的两种设计方案:默认的FiLM调制设计和备选的门控(Gating)融合设计。
表5:不同词边界融合方式的字符错误率对比 表6:不同词边界融合方式的分词F1分数对比
表5和表6:词边界投影模块不同融合方式的性能对比。整体来看,FiLM调制在字符识别和分词两个任务上的表现都优于门控融合。
可以看到,FiLM调制在几乎所有数据集上、无论是CER还是F1都优于门控融合。这说明用缩放+平移的方式来“通知”模型是否输出词边界,比用门控(也就是一个可学习的权重来调节信息流入量)要更有效,特征调制的方式给模型提供了更明确的引导信号。
论文还展示了两个非常直观的可视化结果:一个是识别和分割的定性评估,另一个是词边界的可视化定位。
图6:部分案例的定性评估结果
图6:部分案例的定性评估结果。红色竖条表示漏掉的词边界;斜纹红色竖条表示多余的词边界;红色标记表示识别错误。
图7:词边界在输入图像上的投影位置
图7:词边界在输入图像上的投影位置可视化。红色竖条表示词边界投影位置。对于弯曲严重的文本(如图7c),边界投影会有一定偏差。
图7展示了CTC解码器的一个“隐藏技能”——因为模型是逐帧输出概率的,词边界token在那个时间帧上产生,你可以直接把这一帧对应的图像位置映射回去。结果发现,除了弯曲严重的文本(如图7c)之外,模型预测的边界位置跟实际的词间间隙基本吻合。这意味着模型不仅学会了分词的“语义”,还学会了某种程度上的“视觉定位”。这为后续做文档版面分析、关键信息抽取(比如从身份证、表格里提取字段)提供了想象空间。

局限与展望:从合成数据到真实场景

老实说,这篇论文没有回避自己的短板,在Limitations里直接列了两条。
第一条是训练数据的问题。词边界标注的新数据集是合成生成的,虽然渲染质量很高,但毕竟不是真实场景拍摄的图片。合成数据在印刷体文档上效果不错,但到了场景文本和手写文本这种视觉多样性极高的场景里就有点力不从心了。从表格4也能看出来,分词F1从文档场景的98%掉到手写场景的89%,差距还是相当明显的。这背后的核心原因是:场景文本和手写文本里的词往往是孤立的、短语级的,甚至有很多非文本内容(比如数字、图标),缺乏上下文语境的支持,分词模型能依赖的线索非常有限。
第二条是词边界的监督方式。论文当前的实现是隐式的——词边界token只是作为词汇表中的一个额外类别,通过CTC损失隐式地学习,并没有额外的损失函数来显式地监督“哪些位置应该输出词边界”。也就是说,模型学到的词边界预测能力完全是从CTC对齐过程中“顺带”产生的,缺少直接的梯度信号引导。论文提出未来的工作可以加入显式的词边界监督(比如在词边界位置加一个辅助分类损失),这样应该能进一步提升分词的准确性。
除此之外,论文没有提到但值得思考的一个问题是:梯度干扰。当b=1时,模型需要同时预测字符和词边界两种token,词边界预测的错误会不会反过来干扰字符识别的特征学习?从实验结果看(b=1模式CER略有上升),这种干扰确实存在,但目前看来幅度很小。未来的工作可以考虑设计更精细的条件控制机制,比如用可分离的解耦表征,让字符识别和词边界预测共享一部分特征、各保留一部分私有特征,进一步压缩两个任务之间的互相干扰。
这篇论文的定位很清晰:给低资源语言的高棉语做一套低延迟、高精度、可落地的OCR+分词一体化方案。它不是那种在榜单上刷几个点就完事的论文,而是真的站在工程落地的角度去思考问题。放眼整个OCR领域,类似的“联合识别+后处理任务”的思路其实可以迁移到很多其他语言或场景中。比如泰语、老挝语、缅甸语等同样没有词边界分隔符的语言,都可以借鉴这套“条件控制分词开关”的思路;甚至对于中文来说,如果某些垂直场景(比如古籍识别)也需要在OCR的同时输出分词信息,这个框架也有很强的参考价值。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?针对高棉语识别后仍需单独分词的低效流水线,本文提出KTRWS联合框架,用一个CTC解码器同时输出字符和词边界,在多个基准上精度持平甚至领先,合并任务延迟显著下降。
这篇工作最值得看的点是什么?KTRWS(b=0)在KHOB、KhmerST、KH、KHT上取得最优CER(1.75%、2.77%、5.78%、8.91%),在GKST上略逊于UKTR(4.51% vs 4.41%);KTRWS(b=1)在保持竞争力的同时实现了显著的延迟降低。
这篇工作的边界或风险在哪里?优点:(1)首次实现高棉语文本识别与词分割的联合建模,消除了传统流水线中的额外分割步骤;(2)CTC解码器实现并行解码,显著降低延迟;(3)通过可切换的词边界指令实现灵活输出。缺点:(1)在场景和手写模态下词分割精度仍有提升空间;(2)依赖合成数据训练,真实数据标注不足;(3)词边界预测缺乏显式监督。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种联合高棉语文本识别与词分割的统一模型,通过CTC解码器实现并行解码,并利用可切换的词边界指令(b=0或b=1)在单一模型中同时完成字符识别和词边界预测。

实验合理度:★★★★☆

字符错误率(CER)和词分割F1分数。

学术研究价值:★★★★☆

提出一种联合高棉语文本识别与词分割的统一模型,通过CTC解码器实现并行解码,并利用可切换的词边界指令(b=0或b=1)在单一模型中同时完成字符识别和词边界预测;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

视觉编码器总参数量约23.3M,总浮点运算量约5.55G(输入32×116像素)。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:指令实现灵活输出。缺点:(1)在场景和手写模态下词分割精度仍有提升空间;(2)依赖合成数据训练,真实数据标注不足;(3)词边界预测缺乏显式监督。


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球