← 返回 PaperDaily 大模型与智能体

唐诗地域密码:0.69准确率猜出诗人籍贯

这篇论文很有意思,居然把唐诗当成“地域指纹”来做分类。更妙的是,它不只看准不准,还顺手给文学史抛了几个能讨论的线索:地理距离、时代变化、中心与边缘,模型犯错都能讲出故事。

唐诗地域密码:0.69准确率猜出诗人籍贯
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文很有意思,居然把唐诗当成“地域指纹”来做分类。更妙的是,它不只看准不准,还顺手给文学史抛了几个能讨论的线索:地理距离、时代变化、中心与边缘,模型犯错都能讲出故事。


原论文信息如下:
论文标题:
Predicting Poets’ Origins from Verse: A Computational Analysis of Regional Linguistic Fingerprints in the Complete Tang Poems
发表日期:
2026年06月
发表单位:
Harvard University;University of Washington
原文链接:
https://arxiv.org/pdf/2606.24093v1.pdf
开源代码链接:
https://github.com/ChiShengChen/ctext.org-crawler

唐诗中的地域密码:模型如何识别诗人的籍贯?

唐诗看起来是“风花雪月”的文学世界,实际上也可能偷偷藏着“户口本信息”。本论文干的事就很有意思:把每位唐代诗人的全部作品攒在一起,再看模型能不能仅凭这些诗,猜出他大概来自唐代哪个地区。换句话说,就是让算法当一回“文学侦探”,看看诗句里有没有地域口音、风格偏好和时代烙印。
这件事之所以值得做,是因为传统文学史里一直有个老问题:唐诗到底有没有明显的地域风格?如果有,这种差异是词汇、意象、典故,还是更细的写作习惯?以前更多靠学者细读和经验判断,现在作者把它变成了一个可检验的分类任务。模型不是来替代文学史家的,而是来帮忙“翻土找线索”的。
图1:唐代各道诗人分布(红色为南方,蓝色为北方;每位诗人至少保留5首诗)
图1:唐代各道诗人分布(红色为南方,蓝色为北方;每位诗人至少保留5首诗)。可以看到,样本并不均匀,江南和中原一带诗人更多,边缘地区则少得像“文学界的稀有卡”。
先把术语说清楚。这里的“道”不是唐僧取经那个道,而是唐代行政区划里的高级地理单位。论文把诗人的籍贯标签映射到“道”层面,再进一步合并成南北、三大宏区和十个具体区域。这样做的好处是:既能看粗粒度的南北差异,也能看细粒度的地方风格。
数据来源也很扎实。文本来自《全唐诗》,人物地理标签来自 CBDB(China Biographical Database,中文可译为“中国历代人物传记资料库”)。CBDB 是哈佛大学、中央研究院和北京大学共同维护的历史人物数据库,论文用它来给诗人“落地理坐标”。最终保留下来的是357位、至少有5首诗的诗人。样本不算大,但胜在每个人的作品是聚合后的“诗人级语料”,更像在分析“一个人的写作习惯”,而不是一首诗的偶然灵感。
模型任务也很直接:输入某位诗人的全部诗作,输出他更可能属于哪个地区。听上去像“诗词版人脸识别”,但识别的不是长相,而是语言纹理。要是模型真能分出来,那说明唐诗里确实有某种稳定的区域信号;要是分不出来,也能反过来说明唐诗的“雅言统一”可能压过了地方差异。总之,能不能看出门道,先让模型试试。

90%准确率:从诗词用词中看出南北差异

论文的核心思路并不花哨:先把每位诗人的作品变成向量,再做分类。向量怎么来?一部分是最朴素但很能打的字符 n-gram TF-IDF,另一部分是更“文学味”的人工特征,比如意象、季节、典故密度、词汇丰富度等。TF-IDF 的全称是 Term Frequency–Inverse Document Frequency,中文一般叫“词频-逆文档频率”,意思是:某个字/词在某个诗人作品里出现得多、但在别人的作品里不常见,那它就更像这个诗人的“签名笔画”。
这里有个特别值得注意的地方:论文没有一上来就迷信大模型,而是把传统机器学习和古典中文预训练模型放在同一张桌子上比拼。参与比较的有逻辑回归、线性支持向量机、随机森林、MLP,以及古文预训练模型 GuwenBERT。BERT 的全称是 Bidirectional Encoder Representations from Transformers,中文可理解为“基于 transformer 的双向编码表示模型”;GuwenBERT 则是面向古文的预训练版本。支持向量机的英文是 Support Vector Machine, SVM,中文叫“支持向量机”。
表1:南北分类结果(5折交叉验证),不同模型的对比
表1:南北分类结果(5折交叉验证),不同模型的对比。这里最重要的不是“谁赢了”,而是“赢了多少”。多数基线只有0.53准确率,而最好的模型能到0.69,已经明显高于瞎猜和偏向多数类的水平。
从结果看,最强的是 MLP,南北二分类准确率和宏平均 F1 都达到 0.69。别小看这个数字,它说明模型不是在“蒙对一半”,而是真的从诗里抓到了可重复的区域信号。更有意思的是,线性模型已经不差,随机森林也能打,这意味着信号并不依赖特别复杂的深度结构,字符级别的统计模式本身就足够显眼。
图2:南北分类的模型对比,虚线表示随机水平
图2:南北分类的模型对比,虚线表示随机水平。可以看出,所有模型都明显越过了“瞎猜线”,这说明唐诗中的地域信号不是幻觉,而是确实存在的文本模式。
如果把任务从“南北二分”升级到“十道分类”,难度会立刻上升,毕竟地区越细,诗风越容易互相打架。但论文仍然发现,模型在更细粒度任务上依然高于基线,说明这不是一个只会粗暴切南北的简单现象。换句话说,唐诗里的地域纹理不是只有“大南方”和“大北方”两种颜色,而是有更细的渐变层次。
图5:左图为南北意象特征,右图为最具区分力的字符
图5:左图为南北意象特征,右图为最具区分力的字符。左边告诉人们“写什么”有区别,右边告诉人们“怎么写”也有区别。南方诗人更常写山、水、草木等景物,北方则更容易出现宫廷、宫体和某些更偏中心文化的话语。
这就解释了为什么字符级特征会这么强。中文古诗不是按空格切词的现代文本,很多风格信息就藏在单字和双字的组合里。比如某些山水、佛禅、隐逸相关字眼在南方诗人里更常见,而北方诗人更容易出现宫廷、都城、礼制相关词汇。模型不懂“意境”,但它会数这些字出现了多少次,久而久之就把地域味道闻出来了。
论文还有一个很关键的结论:字符 n-gram TF-IDF 已经足够强。当作者把古文 transformer 和 TF-IDF 结合起来时,并没有带来额外提升;而把整篇作品用分层冻结编码器再聚合后,GuwenBERT 也只是和 TF-IDF 持平,没有显著超过它。这里的“冻结编码器”意思是:先用预训练模型把文本编码,再不更新参数,只把编码结果拿来做后续分类。这个结果很扎实,也很“打脸式诚实”——不是所有地方都需要大模型出马,有时候简单统计反而更稳。

边缘还是中心?江南诗人为何更易识别?

分类结果里最耐人寻味的,不是“整体能分出来”,而是“谁最容易被分出来”。论文发现,江南等边缘或远离政治中心的地区,识别度更高;而长安、洛阳周边的中心区域,反而更容易混淆。这个现象很像现实里的口音:越是离中心远,越容易保留本地味儿;越靠近权力和文化中心,越容易被“标准化”。
图3:十个道的混淆矩阵与可识别度,江南最容易区分
图3:十个道的混淆矩阵与可识别度,江南最容易区分。混淆矩阵的意思很简单:模型把某地诗人错认成别地诗人的频率。江南的“可识别度”明显更高,说明它的语言风格更有独特性。
这部分结果和唐代历史背景其实是对得上的。唐朝中后期,文学中心长期围绕宫廷和都城展开,中心区域的写作习惯更容易趋同;而远离中心的地区,因为文化生态、地理环境和社交圈层不同,反而更容易保留地方特色。论文把这种现象概括为“距离衰减”:离中心越远,语言越不一样。这个说法本来常见于地理语言学,放到唐诗里,居然也能成立。
图4:离长安越远,可识别度越高,边缘地区更有特色
图4:离长安越远,可识别度越高,边缘地区更有特色。这个趋势不是说“越偏远越高级”,而是说中心更容易统一风格,边缘更容易保留差异。文学史在这里像地理学一样,开始讲距离和扩散。
更妙的是,论文并没有把“江南更容易识别”简单归结为样本更多。作者专门做了长度控制,发现即便把每位诗人的文本长度统一,结果也基本稳定。这意味着模型不是靠“谁诗多谁占便宜”,而是真抓到了风格差异。这个控制很重要,不然结果就会变成:江南不是更像江南,只是因为江南诗多,模型读得更饱。那就尴尬了。

盛唐同化与晚唐分化:地域信号如何随时间变化?

如果说空间能影响诗风,那时间当然也不会装作没看见。论文继续追问:地域信号是不是一直都一样强?答案是否定的。作者把唐诗按时代切开,发现南北差异在盛唐时期接近随机水平,而到了晚唐变得最明显。这个变化非常符合历史直觉:盛唐时期中央文化整合能力强,宫廷审美像一把大梳子,把很多地方风格都梳平了;晚唐则中央力量减弱,地方风格开始“冒头”。
图7:左图为篇幅控制,右图为不同年代南北可分性
图7:左图为篇幅控制,右图为不同年代南北可分性。左边说明结果不是“诗写得长所以更好分”;右边则说明地域信号确实会随着时代波动,盛唐最弱,晚唐最强。
这类结果最怕的就是“看起来像历史,其实是数据偏差”。所以作者又做了两个检查:一是控制文本长度,二是看不同年代的样本分布。结果显示,长度不是主因,时代和地域确实有相关性,但地域信号并没有被时代完全吞掉。也就是说,这不是“晚唐样本更少所以更容易分错”的那种低级戏码,而是真有风格变化。
更有戏剧感的是,论文发现早唐的误判几乎清一色是“南方诗人被判成北方诗人”,没有出现相反的大量错误。这个现象非常像历史上的文化吸附:早唐南方文人写作时,往往主动贴近北方和宫廷的主流话语,所以模型也把他们当成“北方口音”。这不是模型笨,恰恰说明模型把历史上的同化趋势读出来了。
图8:按时代统计的误分类方向,早唐几乎全是南转北
图8:按时代统计的误分类方向,早唐几乎全是南转北。这个“错得很一致”的现象,其实就是文学史线索:早唐南方诗人被北方主流风格吸住了。

模型犯错也包含深意:文学史意义的错误分析

这篇论文最有趣的地方之一,是它没有把错误当垃圾桶,而是把错误当证据。很多机器学习论文一看到误分类就开始摆手:“这个先别管,模型还在学。”但这里不一样,作者认真看了模型错在哪、为什么错,而且发现“错法”本身就很有历史解释力。
比如,中心区域常常互相混淆,不是因为模型眼神不好,而是因为这些地区在政治与文化上本来就高度接近;边缘地区更容易被识别,是因为它们保留了更多地方特色。再比如,南北差异在不同历史阶段强弱不一,说明地域风格不是静态标签,而是会被帝国结构、文化重心和文人流动不断改写的动态结果。
图6:各道之间的语言距离会随着地理距离增加而变大
图6:各道之间的语言距离会随着地理距离增加而变大。这里用了 Mantel 检验,简单说就是拿“地理距离矩阵”和“语言距离矩阵”做相关性测试。Mantel 检验的英文全称是 Mantel permutation test,中文常叫“曼特尔置换检验”,常用于比较两个距离矩阵之间是否相关。
这里的相关系数约为0.40,显著性大概在0.09左右,严格说还不算“铁证如山”,但已经足够给出一个方向:地理越远,诗风越不一样。学术上,这种结果很像“有迹象但还需要更多样本”;文学史上,它已经足够让人开始重新审视“区域诗风”这个老话题了。
还有一个很值得点赞的点:作者没有把 transformer 说成万能钥匙。相反,实验结果告诉大家,在这种字符粒度、样本数量有限、且目标是风格统计的任务里,朴素的 TF-IDF 反而非常强。这个结论很重要,因为它提醒研究者:不是所有中文古典文本任务都需要把大模型请上神坛,有时“简单、可解释、便宜”才是最优解。

小结:可解释AI助力文学史研究

这篇论文的价值,不只是做出了一个“能猜出诗人来自哪儿”的分类器,而是证明了可解释机器学习可以成为文学史研究的好帮手。它能做的不是盖棺定论,而是提出问题:为什么江南更容易被识别?为什么盛唐更统一、晚唐更分化?为什么早唐的错误方向几乎总是南转北?这些问题,光靠直觉很难系统回答,但模型可以先把线索摆出来。
从方法上看,这篇论文也很克制:不用炫技式堆模型,而是把“字符统计 + 可解释特征 + 经典分类器”这套组合打磨得很认真。它告诉人们,研究古典中文文本时,最该优先考虑的往往不是模型越大越好,而是特征是否贴近文本结构、评价是否公平、结果是否能和历史背景对上。
如果把这项工作再往前推一步,未来可以继续做三件事:一是把地理粒度细化到更小行政区,看地域指纹是否更清晰;二是加入平仄、声韵等更贴近中古汉语的特征;三是把诗人与诗人之间的风格相似度做成网络,看看“地理相近”和“风格相近”到底是不是一回事。总之,唐诗不是只能背,还可以被计算、被比较、被重新理解。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它回答的是一个很有趣的历史问题:唐诗里能不能看出诗人的地域来源。作者把这个问题变成机器学习分类任务,结果发现南北差异、中心与边缘差异、以及时代变化都能在文本中留下可检测的痕迹。

TF-IDF、GuwenBERT 这些词是什么意思?TF-IDF 是“词频-逆文档频率”,用来衡量某些字词是不是特别像某个作者;GuwenBERT 是面向古文的预训练模型,属于 transformer 家族。论文的一个重要结论是:在这项任务里,简单的字符级 TF-IDF 已经很强,GuwenBERT 并没有明显超越它。

为什么模型的“错判”也有价值?因为错误本身会暴露历史结构。比如早唐南方诗人经常被判成北方诗人,这并不只是模型偏了,而是说明他们的写作确实更接近北方宫廷主流风格。模型的错误,反而成了文学史中的线索。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆ 这不是“发明一个新模型”的路线,而是把文学史问题做成了一个严谨、可解释的计算任务,角度新,方法稳,脑洞也够用。

实验合理度:★★★★☆ 交叉验证、类别不平衡处理、长度控制、时代分层和误分类分析都做了,实验设计比较完整,结论也基本能互相印证。

学术研究价值:★★★★☆ 对文学史、数字人文和可解释机器学习都有启发,尤其适合做“模型生成历史线索”的范例。

稳定性:★★★☆☆ 作为学术分析工具很稳,但样本规模不大,标签也继承了历史数据库的噪声,离工业级部署还差得远。

适应性以及泛化能力:★★★☆☆ 方法思路可迁移到别的古典文本,但是否有效要看文本长度、语言规范程度和标签质量。

硬件需求及成本:★★★★☆ 以字符级特征和经典模型为主,成本不高;即便引入古文 transformer,也是在可控范围内。

复现难度:★★★★☆ 数据与代码都给了,路径清楚,复现门槛不高;主要难点在于历史标签整理和文本清洗。

产品化成熟度:★★☆☆☆ 更适合研究和教学场景,不太像能直接落地成产品的类型,但做数字人文工具很合适。

可能的问题:样本偏小、标签噪声不可避免,距离衰减的显著性还不够强,后续最好补更多区域和更细粒度地理信息。


主要参考文献

[1] Harvard University, Academia Sinica, and Peking University. China Biographical Database (CBDB), 2024.
[2] Yinhan Liu et al. RoBERTa: A Robustly Optimized BERT Pretraining Approach, 2019.
[3] Nathan Mantel. The Detection of Disease Clustering and a Generalized Regression Approach, 1967.
[4] F. Pedregosa et al. Scikit-learn: Machine Learning in Python, 2011.
[5] Donald Sturgeon. The Chinese Text Project: A Dynamic Digital Library of Premodern Chinese, 2021.
[6] Ethan Yan. GuwenBERT: A Pre-trained Language Model for Classical Chinese, 2020.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
唐诗里藏着地域密码,AI也能看出个大概。想和龙哥一起继续拆解这种“看字识人”的有趣论文,来群里边聊边学~
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。