← 返回 PaperDaily 大模型与智能体

北航PoetryQwen:9.7%提升,让大模型真正读懂古诗

AI读懂古诗词,不再只是押韵和翻译!北航团队带来CCPoetry-49K数据集和PoetryQwen模型,让大模型不仅能翻译,还能理解情绪和深层含义,这可是古诗理解的硬核升级。

北航PoetryQwen:9.7%提升,让大模型真正读懂古诗
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
AI读懂古诗词,不再只是押韵和翻译!北航团队带来CCPoetry-49K数据集和PoetryQwen模型,让大模型不仅能翻译,还能理解情绪和深层含义,这可是古诗理解的硬核升级。


原论文信息如下:
论文标题:
System Report for CCL25-Eval Task 5: New Dataset and LoRA-Fine-Tuned Qwen2.5
发表日期:
2026年06月
发表单位:
北京航空航天大学杭州国际创新研究院
原文链接:
https://arxiv.org/pdf/2606.12392v1.pdf
开源代码链接:
https://github.com/XieHaoTao/CCPotery

古诗词理解遇瓶颈?领域专用数据是关键

大模型写诗、翻译古诗早就不是什么新鲜事了,但让AI真正「读懂」一首古诗——理解每个词的含义、整句话的意境、以及诗人藏在字里行间的喜怒哀乐——这可比押韵难得多。现有的研究大多把古诗理解当成一个通用自然语言处理问题来处理,用通用的数据集训练通用的模型,结果呢?翻译可能还对,但问它「这句诗表达了什么情感」「这个典故是什么来历」,模型就懵了。问题出在哪里?出在缺少专门针对古诗欣赏这个任务的高质量数据,也缺少对任务本身的精细分解。
北京航空航天大学的团队就抓住了这个痛点。他们参加CCL25-Eval评测任务5,发现古诗欣赏这件事可以拆成三个具体的子问题:词项解释(Term Interpretation)、语义理解(Semantic Interpretation)和情感推断(Emotional Inference)。然后,他们从多个开源数据集中清洗、对齐,构建了一个高质量的古诗指令数据集CCPoetry-49K,共49404条指令-回答对。最后,用LoRA(Low-Rank Adaptation,低秩适配)微调了Qwen2.5-14B模型,得到了领域专用模型PoetryQwen,在评测任务上综合得分提升了9.7%。
插图
图1:数据清洗与对齐后从多个开源数据集中提取的一个示例,包含标题、作者、内容、词项解释、语义理解与情感推断。

分解任务:三步搞定古诗词欣赏

一篇完整的古诗欣赏,其实包含多个层面的理解。本文借鉴CCL25-Eval Task 5的评测维度,把古诗欣赏任务拆分成三个相互关联的子任务,让模型像语文老师一样逐层解析。

第一层:词项解释

古诗中大量使用典故、通假字、特定意象(比如“杜鹃”、“柳”),这些词在现代汉语中意义可能完全不同。术语解释任务要求模型给出诗句中关键词语的准确释义。比如“故人具鸡黍”中的“黍”,不是泛指粮食,而是特指古代的一种主食。这种细粒度的词汇知识,通用大模型往往一知半解。

第二层:语义理解

在解释完词语后,需要把整句或整首诗翻译成现代汉语,并阐明其深层含义。这不仅仅是字面翻译,还要考虑修辞、倒装、省略等古代汉语语法特点。比如“感时花溅泪”一句,字面是“感伤时令,花都滴下眼泪”,但其实是拟人手法,表达诗人对国破家亡的悲痛。

第三层:情感推断

这一层最难,也最见功力。模型需要从整体上判断诗人创作时的心境——是喜悦、忧愁、思乡、豪迈还是隐逸?比如同样写“月”,李白《静夜思》中的月是思乡,王维《山居秋暝》中的月是悠然。情感推断任务要求模型从四个预定义选项(A、B、C、D)中选出最合适的情感标签,但前提是模型必须真正理解了诗意。
这三个任务层层递进,从字词到句子再到情感,构建了一个完整的古诗欣赏能力框架。已有的古诗数据集很少同时覆盖这三个维度,这也是本文决定自建数据集的原因。

CCPoetry-49K:高质量指令数据集构建实录

数据是领域微调的灵魂。本文团队从多个开源数据源入手,进行了一场大规模的数据清洗与对齐工程。

数据源选择

主要使用了三个公开数据集:

PoetryCN(He et al., 2024):从公开教育网站爬取的古诗数据,包含翻译、注释和评析。

Chinese ancient poetry translation:古诗句与现代翻译对齐的平行语料。

poems-db:包含超过22万首古诗,以及诗人、诗体、朝代、主题等元数据。

这些数据源虽然内容丰富,但结构不一、标注粒度参差不齐。团队做了大量清洗工作:去除重复、统一格式、补全缺失字段,然后按照三个子任务分别提取对应的字段,生成统一的指令-回答对。

数据集规模

最终得到的CCPoetry-49K数据集各子任务分布如下表所示:
表1:CCPoetry-49K中多任务标注的统计分布
表1:CCPoetry-49K中多任务标注的统计分布
可以看出,每个子任务都有数千到两万多的样本,总量接近5万。这个规模对于指令微调来说已经足够,尤其是情感推断任务样本数较少(8282条),可能是因为古诗情感标注的难度更高、成本更大。
插图
图2:CCPoetry-49K数据集中三个子任务的示例展示。

PoetryQwen:LoRA微调Qwen的领域专用模型

有了高质量数据集,接下来就是训练模型。团队选择了阿里云开源的Qwen2.5-14B作为基座模型(参数量14.7B,支持128K tokens长上下文),因为它本身在指令遵循和中文理解方面表现优异,且具备结构化输出的能力,非常适合处理多任务的古诗欣赏问题。
微调方法采用Low-Rank Adaptation(LoRA)(Hu et al., 2022),这是一种高效微调技术:通过在预训练模型的权重矩阵旁插入低秩分解矩阵来微调,只需要更新极少量的参数(约占总参数的万分之一),就能达到接近全量微调的效果,极大降低了显存占用和训练成本。
具体LoRA配置如下:

目标模块:q-proj, k-proj, v-proj, o-proj, gate-proj, up-proj, down-proj(覆盖了注意力层和前馈网络层)

最大输入长度:1240 tokens

LoRA秩(rank):16

LoRA alpha:32

Dropout:0.1

训练周期:2个epoch

学习率:2e-4

随机种子:42(确保可复现)

值得注意的是,针对三个子任务,团队分别训练了三个独立的LoRA适配器(adapter),每个适配器在自己的子任务数据集上单独训练。推理时,根据当前任务加载对应的适配器。这种多适配器架构的好处是:不同任务的知识不会互相干扰,可以更专注地拟合领域特征。整体模型系统命名为PoetryQwen,其结构如图3所示。
图3:PoetryQwen的结构
图3:PoetryQwen的结构。基座模型Qwen2.5-14B在三个子任务上分别进行LoRA微调,得到三个适配器,共同构成PoetryQwen。

评测表现:9.7%的提升从何而来?

团队在CCL25-Eval Task 5评测基准上进行了实验,对比了多个强大基线模型:

Qwen2.5-7B:小尺寸版本作为基线。

Qwen2.5-14B-Instruct:同尺寸的指令微调版本,直接使用,不额外微调。

GLM-4-9B:另一款知名中文大模型。

评测指标包括词项解释和语义理解任务使用BLEU(评估生成翻译的精确匹配)和BERTScore(评估语义相似度),情感推断任务使用Accuracy(分类准确率)。最终综合得分Score为三项得分的加权和。
表2:诗欣赏任务上模型性能的定量比较
表2:诗欣赏任务上模型性能的定量比较。PoetryQwen在综合得分上达到0.757,相比Qwen2.5-14B-Instruct(0.690)提升9.7%。
从表中可以清晰看到几个关键信息:

词项解释提升最大:PoetryQwen的BLEU从0.169暴增至0.405,提升超过2倍,BERTScore也从0.865提升到0.909。这说明领域专有词汇的翻译能力通过指令微调得到了显著增强。通用模型(如Qwen2.5-14B-Instruct)在术语解释上得分很低,正是因为它缺乏古诗中典故、通假字等专项知识。

语义理解也有稳定提升:BLEU从0.251提升到0.436,BERTScore从0.910提升到0.914。虽然BERTScore提升幅度不大(因为基础模型语义理解已经不错),但BLEU的大幅提升表明生成的现代汉语翻译更加准确、与参考答案更匹配。

情感推断小幅提升:准确率从0.832提升到0.847。情感推断任务本身比较难,且数据量较少(8282条),能有1.5%的绝对提升已经不错。值得注意的是,PoetryQwen对情感推断的输出做了后处理对齐(使用Qwen2.5-14B-Instruct将生成的自由文本映射到四个情感标签上),这保证了评测格式一致,但也可能引入部分噪声。

综合得分:PoetryQwen以0.757的总分超过Qwen2.5-14B-Instruct的0.690,相对提升9.7%,也优于7B版本和GLM-4-9B。这表明领域专用数据+LoRA微调的路线是有效的。

整体来看,CCPoetry-49K数据集为模型提供了大量经过对齐的高质量指令样本,使得模型能够学懂古诗中的术语、句式和情感模式,而不仅仅是在通用语料上泛泛地猜。这种"领域专用数据+高效微调"的范式,为其他垂直领域的LLM应用提供了很好参考。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文主要解决了什么问题?现有大模型在处理古诗欣赏时,缺乏领域专用数据和任务分解,往往把古诗当成通用文本处理。本文提出了三个子任务(词项解释、语义理解、情感推断),构建了CCPoetry-49K数据集,并用LoRA微调Qwen2.5-14B得到了PoetryQwen,在评测任务上提升了9.7%。

LoRA是什么?为什么用LoRA而不用全量微调?LoRA全称是Low-Rank Adaptation(低秩适配),是一种参数高效微调方法。它通过在原始权重的旁边插入两个小的低秩矩阵来更新,只训练这两个小矩阵,而保持预训练权重冻结。这样训练参数量大大减少(通常只有0.1%~1%),显存占用低,训练速度快,且能达到接近全量微调的效果。对于14B这样的大模型,全量微调需要大量GPU资源,而LoRA在单卡A100上就能训练。

PoetryQwen三个适配器是分开训练的,为什么不合并一个?原文中分别训练三个LoRA适配器,每个对应一个子任务。这样做的好处是任务之间不会互相干扰:词项解释任务偏向词汇知识,语义理解任务偏向句子翻译,情感推断任务偏向情感分类,三者知识分布不同。分开训练可以更精细地调整每个适配器的参数,在测试时也有针对性。如果合并训练,可能由于数据不平衡(情感推断数据量最小)而导致模型偏向数据量大的任务。不过这也带来了部署时不方便的问题(需要加载三个适配器)。实际应用中可以根据资源情况选择是否合并。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★✰✰

任务分解和数据集构建是主要贡献,但LoRA微调本身是成熟技术,缺乏方法上的原创突破。不过将古诗欣赏细化为三个子任务并构建专用数据集,在领域应用层面有创新性。

实验合理度:★★★★✰

对比了三个基线模型(含不同尺寸),评测指标全面(BLEU、BERTScore、Accuracy),结果展示清晰。但缺少一些消融实验,例如不使用LoRA而直接对Qwen2.5-14B进行全量微调的效果如何?另外,缺少与更大模型(如Qwen2.5-72B或其他厂家大模型)的对比,说服力可以更强。

学术研究价值:★★★★✰

这项工作为古诗自然语言处理提供了一个标准化的任务框架和高素质数据集,对后续研究有重要参考价值。特别是任务分解的思路(词项、语义、情感)可以推广到其他古典文本(如文言文、词曲)的理解中。

稳定性:★★★★✰

LoRA微调训练稳定,超参经过调优(学习率2e-4,2个epoch),实验设置严谨。但三个适配器的部署增加了推理时的复杂度,不同适配器之间的切换可能引入不一致。

适应性以及泛化能力:★★★✰✰

模型仅针对古诗三个子任务训练,在其他古诗相关任务(如古诗年代判断、作者识别)上的泛化能力未验证。数据集主要由教育网站爬取,可能存在分布偏差(如偏重常见古诗)。不过,领域专用模型本身就没必要追求强泛化,在领域内表现好即可。

硬件需求及成本:★★★★✰

LoRA训练14B模型,一张A100 80G显卡可以完成(通常需要约70-80GB显存),训练2个epoch大概需要几小时。推理时加载14B模型也需要较高硬件(至少16GB显存的消费级显卡)。对于个人研究者来说门槛尚可,但大规模部署成本较高。

复现难度:★★★✰✰

代码已经开源(GitHub: XieHaoTao/CCPotery),数据集也已公开,但数据清洗和构造过程需要一定工作量才能完全复现。LoRA超参配置说明清晰,按照论文设置应该可以复现结果。

产品化成熟度:★★✰✰✰

目前还处于研究验证阶段,距离直接产品化还有距离。14B模型推理速度较慢,不适合实时交互。且古诗欣赏是一个低频、长尾需求,商业化场景有限。不过可以集成到古诗学习App中作为辅助工具。

可能的问题:论文缺少对生成内容质量的细致分析——BLEU和BERTScore只能反映与参考答案的接近程度,不能反映答案是否真正合理。例如,模型可能生成一串流畅但错误的诗句解释,却因为与参考答案部分匹配而得分较高。另外,情感推断任务只有3.8万数据,且只做了后处理对齐,模型可能只是学到了标签映射而并未真正理解情感。建议增加人工评价或对抗性测试。



主要参考文献

[1] Hu, E. J., Shen, Y., Wallis, P., et al. (2022). LoRA: Low-Rank Adaptation of Large Language Models. ICLR.
[2] Chen, A., Lou, L., Chen, K., et al. (2024). Large Language Models for Classical Chinese Poetry Translation: Benchmarking, Evaluating, and Improving. CCL25-Eval Task 5.
[3] He, C., Li, W., Jin, Z., et al. (2024). OpenDataLab: Empowering General Artificial Intelligence with Open Datasets.
[4] Liu, D., Yang, K., Qu, Q., & Lv, J. (2019). Ancient–Modern Chinese Translation with a New Large Training Dataset. ACM TALLIP.
[5] Li, W., Qi, F., Sun, M., et al. (2021). CCPM: A Chinese Classical Poetry Matching Dataset.
[6] Cao, J., Liu, Y., Shi, Y., et al. (2024). WenMind: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Classical Literature. NeurIPS.
[7] Zhou, B., Chen, Q., Wang, T., et al. (2023). WyWeb: A NLP Evaluation Benchmark for Classical Chinese.
[8] Qwen Team. (2024). Qwen2.5 Technical Report. arXiv.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
AI读懂古诗词,比你想的还浪漫!想了解更多古诗理解的黑科技?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 古诗理解+北京+北航+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。