← 返回 PaperDaily 大模型与智能体

46语言屠榜!小米开源翻译模型无参考后训练超GPT-5

这可能是目前“无参考后训练”最扎实的一篇落地研究:小米直接用GRPO把46语言翻译模型的无参考质量分数推过了谷歌翻译和GPT-5,还顺手开源了模型和代码。想搞懂“不依赖参考译文怎么训翻译模型”,这篇值得精读。

46语言屠榜!小米开源翻译模型无参考后训练超GPT-5
原论文信息如下:
论文标题:
面向开源大语言模型多语言机器翻译的无参考后训练

发表日期:
2026年08月

发表单位:
小米(Xiaomi Inc.)

原文链接:
https://arxiv.org/pdf/2608.10812v1.pdf

开源代码链接:
论文提到模型和代码已发布,但未给出具体仓库地址,可关注论文页面后续更新。

要论手边最被低估的 AI 工具,机器翻译的群众基础大概稳居前三。可有个核心问题很少有人细想:判断一段译文到底翻得好不好,非得有一份标准译文当“标准答案”吗?传统机器翻译的训练和评测都离不开平行语料——也就是“源句+标准译文”的配对。但高质量对照文本恰恰最难搞,换到低资源语言更是雪上加霜。小米团队这篇工作做了一个相当反常规的选择:借助无参考质量估计(QE,Quality Estimation)直接给译文打分,再通过 GRPO 强化学习把模型往高分方向推。结果 46 种语言全面开花,12B 模型还真就在多项指标上追平甚至超过了谷歌翻译和 GPT-5。下面就跟龙哥一起拆一拆,这套“没有参考答案的炼金术”到底是怎么运作的。
在正式进入技术细节之前,有必要先厘清一个背景:为什么“无参考”这件事如此重要?传统机器翻译的评测体系,无论是 BLEU、spBLEU 还是基于参考译文的 COMET 类指标,都依赖至少一条人工撰写的标准译文作为比对基准。然而,全球有超过 7000 种语言,其中绝大多数语言对之间并不存在规模可观的平行语料。即便像英语、中文这样的高资源语言,特定领域(如法律、医学)的高质量对照文本也常常是稀缺资源。这种数据层面的结构性短缺,直接制约了监督式训练方法的天花板。无参考质量估计技术的成熟,恰好为打破这一瓶颈提供了可能:如果模型本身能够判断译文好坏,那么训练就不再需要“标准答案”,海量的单语源文本就能被充分利用起来。这正是小米这篇工作最核心的出发点。

多语言翻译的瓶颈:参考数据稀缺

机器翻译模型的质量上限,很大程度上取决于训练时喂进去的平行语料——也就是源语言句子和目标语言标准译文这样的配对数据。问题在于,这类数据的获取成本极高。英语和中文等大语种的平行语料相对好收集,但一旦落入低资源语言,比如论文评测中涉及的豪萨语、僧伽罗语等,能找到的高质量对照文本就非常有限。更麻烦的是,翻译方向的覆盖也不均匀,很多语言对之间的平行语料几乎是零。这种数据荒直接限制了传统监督微调(SFT,Supervised Fine-Tuning,监督微调)的进一步提效空间。
但换个角度看,纯源端的单语文本其实非常丰富。问题是怎么利用这些没有标准答案的源文本去提升翻译质量。这正是论文所称“无参考后训练”的切入点:不需要目标侧参考译文,只依赖源句和模型自己生成的候选译文来构造训练信号。
为了更具体地理解数据稀缺的严重程度,可以看论文附录中给出的语言资源分类。46 种语言按照 Joshi et al. (2020) 的分类体系,被划分为从高资源到极低资源的多个层级。其中既有英语、中文、法语这样的高资源语言,也有豪萨语、林加拉语、僧伽罗语等极低资源语言。对于后者,公开可得的平行语料往往只有几千到几万句对,远不足以支撑大规模监督训练。而单语语料虽然同样有限,但获取门槛要低得多——维基百科、公共新闻、开源书籍等渠道都能提供相当规模的源语言文本。无参考后训练的核心价值,就在于把这些原本“用不上”的源端数据,转化成了有效的训练信号。

无参考后训练:用GRPO解锁源端数据价值

论文的后训练框架以GRPO为核心。GRPO的全称是Group Relative Policy Optimization,组相对策略优化,最早由DeepSeek团队提出。它在每个样本上采样一组候选输出,用组内相对优势来更新策略,省去了传统PPO(近端策略优化)里独立的Critic价值网络,训练成本低了不少。对翻译这种生成任务来说,候选译文之间的相对好坏,比绝对评分更有训练意义。
公式:token级别重要性比率
公式中 ri,t(θ) 表示新旧策略在给定上下文下生成当前token的概率比值,配合组归一化优势 Â 一起控制更新幅度。GRPO 目标还带了一项KL散度惩罚,把强化学习策略约束在 SFT 参考策略附近,防止 RL 阶段把语言能力带偏。
具体到翻译任务,强化学习需要一个“奖励信号”来判断译文好坏。这里有一个很直接的想法:用无参考质量估计模型。质量估计(QE,Quality Estimation)模型可以在没有标准译文的情况下,给一条源句和一条候选译文的相关性打分。论文选用了两个强力的QE模型——XCOMET²COMETKiwi,两者都是10B参数规模的大模型,与人类评分有较高的相关性。XCOMET² 是一种基于多模态模型的质量评估框架,COMETKiwi 则采用跨语言表示微调的回归模型来直接预测质量分数。两者各有侧重,论文直接取了它们的平均值作为基础奖励。
这里有个隐患:QE模型有时会给“输出语言正确但语义偏飞”的译文打高分。为了防止语言窜味儿,论文在奖励函数上加了一道语言门控:用 OpenLID-v3 这个语言识别工具检测输出语言,只有检测结果与目标语言一致时才给奖励,否则直接给0。这种设计很巧妙地堵住了强化学习中常见的 reward hacking(奖励黑客)漏洞——模型没法靠输出错误语言来刷分了。
公式:奖励函数定义
R(x,y,ℓ) 是最终奖励:当预测语言 ℓ̂(y) 等于目标语言 ℓ 时,取 XCOMET² 分数 sX 和 COMETKiwi 分数 sK 的平均;否则直接给0。这一设计把质量与语言正确性绑在了一起。
用这套奖励函数去准备RL训练数据时,论文还有一番讲究:原始SFT数据里有26万多个实例,但如果一组候选译文得分全都差不多,GRPO就学不到东西。于是论文先按RL采样配置生成G=8条候选译文,然后用奖励函数打分,只保留组均值在0.30到0.95之间、组标准差不低于0.05的实例——简单说,既不要整体太差的,也不要整体太好的,要的就是那些内部有分歧的样本。这样过滤下来还剩31572条,约占总数的12%,覆盖192个翻译方向。表3给出了各翻译方向的数据量分布,可以看到低资源方向也保留了一定的训练样本。
表3:RL训练数据各翻译方向的实例数量分布
表3:RL训练数据中每个翻译方向的实例数量(按训练数量排序),共192个方向,总计30572条训练/1000条验证。
这里值得展开说一下数据筛选的逻辑。GRPO 的训练信号来自组内候选之间的相对差异,如果一组候选译文得分都差不多,那么优势函数的值就会趋近于零,策略更新几乎不会发生。反过来,如果一组候选得分都极高或都极低,虽然组内差异可能仍然存在,但整体分布偏离了有效学习区间——得分都极高意味着模型已经做得很好,进一步优化的空间有限;得分都极低则可能意味着源句本身存在歧义或噪声,学到的模式未必能泛化。论文选择的 0.30 到 0.95 区间,大致对应了“有一定质量基础但仍有明显改进空间”的样本,而 0.05 的标准差阈值则保证了组内确实存在可学习的差异。这种筛选策略虽然简单,却非常有效,它确保了有限的训练预算被用在了最能产生学习信号的样本上。

检查点插值:兼顾质量与词汇重叠的平衡术

强化学习跑完,模型的无参考质量确实提升了,但论文发现一个熟悉的副作用:RL后的模型在参考译文上的 spBLEU 下降了。spBLEU 是基于 SentencePiece 子词单元计算的 BLEU 值,衡量的是译文与某一条标准译文的词汇重叠程度。问题在于,翻译本来就是一对多的事情,一个源句往往有不止一种地道翻法;RL学到的译文可能在语义上更好,但跟标准答案的重合度未必最高。因此,spBLEU 的下降并不完全等于翻译变差。
话虽如此,BLEU 类指标在业界认可度仍然很高,完全舍弃不现实。论文采用的补救办法非常朴素:把 SFT 检查点和 RL 检查点的参数直接做线性插值。
公式:检查点线性插值
θα = αθSFT + (1−α)θRL,α ∈ [0,1]。这里 α 控制 SFT 检查点的权重:α=0 就是纯 RL 模型,α=1 回到 SFT 模型。论文在三个模型规模上都做了验证:随着 α 增大,spBLEU 单调回升,而基于参考的 XCOMET 只有轻微下降。
图2:spBLEU与参考XCOMET在SFT-RL检查点插值下的权衡曲线
图2:FLORES+ 上四种翻译方向组平均的 spBLEU 与基于参考的 XCOMET 权衡曲线。每条彩色曲线对应一个模型规模,α 表示 SFT 权重,MiLMMT-46-v0.1-RL 和 MiLMMT-46-v0.1 分别是曲线的两个端点,圈出的点是选定的 MiLMMT-46-v1.0 检查点(α=0.5)。
从图2能看得很直观,曲线呈现一个漂亮的权衡形态。最终论文挑了一个简单且普适的 α=0.5,既找回了一大部分 spBLEU,又保留了绝大部分质量增益。这招儿虽然朴实,但在工程上是真的好用,几乎零成本——不需要额外训练,只需要对两个检查点做一次参数加权平均。
检查点插值之所以有效,背后有一个值得注意的观察:RL 训练虽然整体上提升了模型的无参考质量,但这种提升在不同方向、不同样本上并不是均匀的。有些方向上 RL 带来的改进非常显著,而另一些方向上可能只是微调。线性插值相当于在参数空间里找到了一个折中点,它既保留了 RL 在大多数方向上的改进,又通过 SFT 参数的“锚定”作用,抑制了 RL 在少数方向上可能引入的偏移。这种方法的普适性在于,它不需要针对每个方向单独调参,一个全局的 α=0.5 就能在绝大多数情况下取得良好的平衡。

在线策略蒸馏:能否替代强化学习?

既然 RL 效果好,那能不能把这个效果从一个 12B 大模型迁移到更小的模型上,省得每个规模都单独跑一遍强化学习?论文用在线策略蒸馏(OPD,On-Policy Distillation,在线策略蒸馏)来回答这个问题。
OPD 的核心是让小模型(学生)自己采样输出,然后让大模型(老师)在这些输出上提供一个学习信号。具体有两种实现方式:GKD(Generalized Knowledge Distillation,广义知识蒸馏)直接在分布层面做 KL 对齐,而PG-OPD(Policy Gradient OPD,策略梯度形式的在线策略蒸馏)则把每 token 的 log 概率差当成奖励,用 RL 更新。论文主推 PG-OPD,这样蒸馏和前面的 GRPO 可以在同一个优化框架下进行。
公式:在线策略蒸馏损失 公式:token级散度估计 公式:策略损失与蒸馏损失的加权组合
三个公式分别对应 OPD 的损失函数、单样本逆 KL 散度估计器 Dt,以及 RL 损失与蒸馏损失的加权组合 L = Lpolicy + λLdistill。λ 控制蒸馏信号对策略更新的贡献强度。
论文对比了三种训练变体:纯 OPD、RL+OPD(两者按 λ 加权)、以及从 v1.0 检查点初始化的 OPD。结果见表2:OPD 逼近了 v1.0 基线的水平,但并没有真正超越。在 1B 和 4B 规模上,蒸馏后的学生和直接做 RL+插值的模型打得有来有回。用论文的话说,蒸馏是一条稳健的替代路径,但不是一条更优路径。
图1与表2:GRPO训练奖励曲线与在线策略蒸馏结果
该组合图包含论文的图1(GRPO后训练过程中1B/4B/12B规模的训练与验证奖励曲线)和表2(从MiLMMT-46-12B-v1.0蒸馏到1B和4B学生模型的结果,括号内标注学生初始化方式)。蒸馏后的学生与RL+插值基线互有胜负,整体并未拉开差距。
如果蒸馏的最终目的是把12B的能力下放到小模型,那这套结果是过关的;但如果想再进一步把质量前沿继续抬高,那靠蒸馏还不够。这个结论其实挺有信息量——说明 RL 过程本身学到的东西,有一部分是很难被蒸馏完全拾取的。
为什么蒸馏难以完全替代 RL?一个可能的原因是,RL 的奖励信号来自 QE 模型,而 QE 模型的评分函数本身就是一个复杂的非线性映射。蒸馏过程中,学生模型只能通过模仿老师的输出分布来间接学习这个映射,而无法直接接触到 QE 模型的评分信号。这意味着,如果老师在某些样本上的输出分布存在偏差,学生就会继承这些偏差,而无法像 RL 那样通过直接的奖励反馈来纠正。此外,RL 训练中 GRPO 的组内相对优势机制,天然鼓励模型探索组内差异较大的输出空间,这种探索行为在蒸馏中是不存在的——学生只是被动地模仿老师,而不是主动地探索更好的翻译策略。

46语言全面评测:超越专有系统的开源新标杆

论文的实验规模相当扎实:46种语言,覆盖英语中心、中文中心的四个方向组(en→xx、xx→en、zh→xx、xx→zh),在 FLORES+ 和 WMT24++ 两个基准上评估。46种语言列表见表4,从豪萨语、爪哇语到冰岛语都有,资源类别各不相同。
表4:模型支持的46种语言列表
表4:模型支持的46种语言,资源类别按 Joshi et al. (2020) 的分类体系确定,覆盖从高资源到极低资源的多个层级。
主结果见表1。论文按语言覆盖子集分块对比,搭配多组开源和闭源基线。先看最核心的46语言全量块:MiLMMT-46-12B-v1.0 在无参考 XCOMET 和 COMETKiwi 上均拿到最高的平均分,超过了谷歌翻译、Gemini 3 Pro 和 GPT-5;在参考 XCOMET 方面,四个方向组有三个排进前二。另一个让人印象深刻的点是效率:MiLMMT-46-1B-v1.0 虽然参数规模只有 TranslateGemma-4B 的四分之一,但在每一个报告的 WMT24++ 和 FLORES+ 指标上都超过了 TranslateGemma-4B。
表1:WMT24++和FLORES+上的翻译性能总览
表1:WMT24++ 和 FLORES+ 上的翻译性能总览。WMT24++ 的 QE 列报告无参考 XCOMET/COMETKiwi;FLORES+ 的 Ref. 列报告 spBLEU/参考XCOMET,QE 列报告无参考 XCOMET/COMETKiwi。每个语言覆盖块内各指标的最优和次优分别用粗体和下划线标出。
把范围放到不同语言子集上,MiLMMT-46-12B-v1.0 在21/26/28/31语言子集中,与 Tower-Plus、Seed-X、GemmaX2、HY-MT 系列对比,16次参考 XCOMET 比较里有15次排第一;MiLMMT-46-4B-v1.0 甚至能和 Tower-Plus-72B、HY-MT2-30B-A3B 这些大一个量级的模型打平。
训练过程也很耐看。图1展示了三个模型规模下 GRPO 训练和验证奖励的变化曲线:训练初段快速上升,随后趋于平稳,没有出现明显的过拟合或奖励坍塌。这种稳定性在 RL 后训练里并不常见,也从侧面说明奖励设计里的语言门控和 KL 约束起了实际作用。
图1:GRPO后训练期间的训练与验证奖励曲线
图1:1B、4B、12B规模下 GRPO 后训练的训练与验证奖励曲线,验证奖励每50步评估一次。三条曲线均呈现快速上升后趋于平稳的形态。
配合论文附录中的细粒度表格,还能进一步看到每个语言方向上的具体表现。为了节省篇幅,这里把 WMT24++ 和 FLORES+ 的完整无参考和参考基线的方向级结果一并放在下面:
表6:WMT24++基准上基线模型(第一部分)的无参考评测结果
表6:WMT24++ 基准上基线模型(第一部分)的无参考评测结果(XCOMET/COMETKiwi)。
表7:WMT24++基准上基线模型(第二部分)和MiLMMT模型的无参考评测结果
表7:WMT24++ 基准上基线模型(第二部分)和 MiLMMT 模型的无参考评测结果。
表8:FLORES+基准上英文中心无参考评测结果(基线模型第一部分)
表8:FLORES+ 基准上英文中心无参考评测结果(XCOMET/COMETKiwi),基线模型第一部分。
表9:FLORES+基准上英文中心无参考评测结果(基线模型第二部分和MiLMMT模型)
表9:FLORES+ 基准上英文中心无参考评测结果,基线模型第二部分和 MiLMMT 模型。
表10:FLORES+基准上中文中心无参考评测结果(基线模型第一部分)
表10:FLORES+ 基准上中文中心无参考评测结果(XCOMET/COMETKiwi),基线模型第一部分。
表11:FLORES+基准上中文中心无参考评测结果(基线模型第二部分和MiLMMT模型)
表11:FLORES+ 基准上中文中心无参考评测结果,基线模型第二部分和 MiLMMT 模型。
表12:FLORES+基准上英文中心基于参考评测结果(基线模型第一部分)
表12:FLORES+ 基准上英文中心基于参考评测结果(spBLEU/XCOMET),基线模型第一部分。
表13:FLORES+基准上英文中心基于参考评测结果(基线模型第二部分和MiLMMT模型)
表13:FLORES+ 基准上英文中心基于参考评测结果,基线模型第二部分和 MiLMMT 模型。
表14:FLORES+基准上中文中心基于参考评测结果(基线模型第一部分)
表14:FLORES+ 基准上中文中心基于参考评测结果(spBLEU/XCOMET),基线模型第一部分。
表15:FLORES+基准上中文中心基于参考评测结果(基线模型第二部分和MiLMMT模型)
表15:FLORES+ 基准上中文中心基于参考评测结果,基线模型第二部分和 MiLMMT 模型。
表5:GRPO训练超参数
表5:三个模型规模共享的 GRPO 训练超参数。论文使用 verl 框架和 vLLM 加速采样,G=8,KL 惩罚项设置为低方差模式。
需要提醒的是,这些附录表格中部分基线的翻译质量标记为低质量(WMT24++ 数据集中带标注的句子),在对比时要留意语言子集和方向不完全一致的问题。另一层是参考-free 评估本身也在演进,不同 QE 模型之间可能存在系统性偏差,所以跨论文直接比较绝对值需要谨慎。
从评测结果来看,有几个值得注意的细节。首先,MiLMMT-46-12B-v1.0 在无参考指标上的领先幅度,在不同语言子集上并不均匀。在低资源语言方向上,领先优势往往更大,这恰好印证了无参考后训练的核心价值——它特别擅长利用有限的源端数据来提升那些平行语料稀缺的方向。其次,在参考 XCOMET 指标上,虽然 12B 模型在大多数子集上排进前二,但并非总是第一,这说明无参考优化带来的质量提升,与参考译文的语义一致性并不完全等价。最后,1B 模型的表现尤其亮眼,它在所有报告指标上都超过了参数规模四倍于它的 TranslateGemma-4B,这为资源受限的部署场景提供了一个非常有吸引力的选择。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?小米发布MiLMMT-46-v1.0,通过无参考强化学习(GRPO)+ 检查点插值,让开源模型在46种语言翻译上无参考质量评分超越谷歌翻译、Gemini 3 Pro和GPT-5,模型和代码全部开源。
这篇工作最值得看的点是什么?MiLMMT-46-12B-v1.0在WMT24++和FLORES+四个方向组上均取得最高的参考-free XCOMET和COMETKiwi分数,超越Google Translate、Gemini 3 Pro和GPT-5等专有系统;1B模型在多数指标上超越TranslateGemma-4B。
这篇工作的边界或风险在哪里?优点:1)提出无参考后训练框架,有效利用源端数据;2)语言门控奖励机制有效抑制奖励黑客;3)检查点插值提供可控的质量权衡;4)系统验证了OPD作为替代方案的可行性。缺点:1)spBLEU相比SFT略有下降;2)RL数据筛选过程可能引入选择偏差;3)OPD未能超越RL+插值的质量前沿。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

采用GRPO强化学习,以两个无参考质量评估模型(XCOMET和COMETKiwi)的平均分并辅以语言识别门控作为奖励,对SFT模型进行后训练,再通过SFT与RL检查点线性插值获得最终模型。

实验合理度:★★★★☆

参考-free XCOMET、COMETKiwi;参考-based spBLEU、XCOMET。

学术研究价值:★★★★☆

采用GRPO强化学习,以两个无参考质量评估模型(XCOMET和COMETKiwi)的平均分并辅以语言识别门控作为奖励,对SFT模型进行后训练,再通过SFT与RL检查点线性插值获得最终模型;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

不适用(论文未明确给出FLOPs或具体推理速度数据)

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1)spBLEU相比SFT略有下降;2)RL数据筛选过程可能引入选择偏差;3)OPD未能超越RL+插值的质量前沿。

主要参考文献

[1] Chris Han, Pengzhi Gao, Pei Fu, Jian Luan. Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation. arXiv:2608.10812v1.
[2] Shao et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. 2024. (GRPO算法来源)
[3] Guerreiro et al. xCOMET: Bridging Multimodal and Multilingual Machine Translation Quality Estimation. 2024.
[4] Rei et al. COMETKiwi: IST-Unbabel 2023 Submission for the Quality Estimation Shared Task. 2023.
[5] Agarwal et al. On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes. ICLR 2024.
[6] Zheng et al. HY-MT: Scaling Hybrid Machine Translation with LLMs. 2025-2026.

融会贯通

结合 PaperDaily 已收录论文可观察到,在 FLORES+ 和 WMT24++ 这两个基准上,MiLMMT-46-v1.0 系列与既有同类方法相比确实处于较优位置,但这一观察目前更多停留在定性层面——不同论文使用的语言子集、参考译文版本、QE 模型版本和评估脚本都可能存在差异,跨论文直接比对绝对值需要格外小心。从论文自身的数据来看,优势的显著性主要体现在无参考 XCOMET/COMETKiwi 这类学习式质量指标上,而 spBLEU 这类词汇重叠指标并不总是占优。这说明无参考后训练带来的是“更接近人类偏好”的译文,而不是“更像某一条标准译文”的译文。
对工程团队来说,这篇论文真正值得借鉴的其实是那套“组合拳”的稳定性:语言门控防止奖励黑客、数据筛选保证训练信号有效、检查点插值弥补指标偏移、蒸馏探索验证可迁移性。每一步都没有花哨的操作,但每一步都踩在要害上。未来如果社区能在统一的46语言评测集上做更多交叉验证,这类无参考后训练方法的真实水平会看得更清楚——这或许也是论文开源模型和代码之后,最值得期待的事情。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       


转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球