← 返回 PaperDaily
大模型与智能体
唐诗地域密码:0.69准确率猜出诗人籍贯
这篇论文很有意思,居然把唐诗当成“地域指纹”来做分类。更妙的是,它不只看准不准,还顺手给文学史抛了几个能讨论的线索:地理距离、时代变化、中心与边缘,模型犯错都能讲出故事。
龙哥读论文
发布于 2026-08-15 00:20:09
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇论文很有意思,居然把唐诗当成“地域指纹”来做分类。更妙的是,它不只看准不准,还顺手给文学史抛了几个能讨论的线索:地理距离、时代变化、中心与边缘,模型犯错都能讲出故事。
原论文信息如下:
唐诗中的地域密码:模型如何识别诗人的籍贯?
唐诗看起来是“风花雪月”的文学世界,实际上也可能偷偷藏着“户口本信息”。本论文干的事就很有意思:把每位唐代诗人的全部作品攒在一起,再看模型能不能仅凭这些诗,猜出他大概来自唐代哪个地区。换句话说,就是让算法当一回“文学侦探”,看看诗句里有没有地域口音、风格偏好和时代烙印。
这件事之所以值得做,是因为传统文学史里一直有个老问题:唐诗到底有没有明显的地域风格?如果有,这种差异是词汇、意象、典故,还是更细的写作习惯?以前更多靠学者细读和经验判断,现在作者把它变成了一个可检验的分类任务。模型不是来替代文学史家的,而是来帮忙“翻土找线索”的。
先把术语说清楚。这里的“道”不是唐僧取经那个道,而是唐代行政区划里的高级地理单位。论文把诗人的籍贯标签映射到“道”层面,再进一步合并成南北、三大宏区和十个具体区域。这样做的好处是:既能看粗粒度的南北差异,也能看细粒度的地方风格。
数据来源也很扎实。文本来自《全唐诗》,人物地理标签来自 CBDB(China Biographical Database,中文可译为“中国历代人物传记资料库”)。CBDB 是哈佛大学、中央研究院和北京大学共同维护的历史人物数据库,论文用它来给诗人“落地理坐标”。最终保留下来的是357位、至少有5首诗的诗人。样本不算大,但胜在每个人的作品是聚合后的“诗人级语料”,更像在分析“一个人的写作习惯”,而不是一首诗的偶然灵感。
模型任务也很直接:输入某位诗人的全部诗作,输出他更可能属于哪个地区。听上去像“诗词版人脸识别”,但识别的不是长相,而是语言纹理。要是模型真能分出来,那说明唐诗里确实有某种稳定的区域信号;要是分不出来,也能反过来说明唐诗的“雅言统一”可能压过了地方差异。总之,能不能看出门道,先让模型试试。
90%准确率:从诗词用词中看出南北差异
论文的核心思路并不花哨:先把每位诗人的作品变成向量,再做分类。向量怎么来?一部分是最朴素但很能打的字符 n-gram TF-IDF ,另一部分是更“文学味”的人工特征,比如意象、季节、典故密度、词汇丰富度等。TF-IDF 的全称是 Term Frequency–Inverse Document Frequency ,中文一般叫“词频-逆文档频率”,意思是:某个字/词在某个诗人作品里出现得多、但在别人的作品里不常见,那它就更像这个诗人的“签名笔画”。
这里有个特别值得注意的地方:论文没有一上来就迷信大模型,而是把传统机器学习和古典中文预训练模型放在同一张桌子上比拼。参与比较的有逻辑回归、线性支持向量机、随机森林、MLP,以及古文预训练模型 GuwenBERT。BERT 的全称是 Bidirectional Encoder Representations from Transformers ,中文可理解为“基于 transformer 的双向编码表示模型”;GuwenBERT 则是面向古文的预训练版本。支持向量机的英文是 Support Vector Machine, SVM ,中文叫“支持向量机”。
从结果看,最强的是 MLP,南北二分类准确率和宏平均 F1 都达到 0.69。别小看这个数字,它说明模型不是在“蒙对一半”,而是真的从诗里抓到了可重复的区域信号。更有意思的是,线性模型已经不差,随机森林也能打,这意味着信号并不依赖特别复杂的深度结构,字符级别的统计模式本身就足够显眼。
如果把任务从“南北二分”升级到“十道分类”,难度会立刻上升,毕竟地区越细,诗风越容易互相打架。但论文仍然发现,模型在更细粒度任务上依然高于基线,说明这不是一个只会粗暴切南北的简单现象。换句话说,唐诗里的地域纹理不是只有“大南方”和“大北方”两种颜色,而是有更细的渐变层次。
这就解释了为什么字符级特征会这么强。中文古诗不是按空格切词的现代文本,很多风格信息就藏在单字和双字的组合里。比如某些山水、佛禅、隐逸相关字眼在南方诗人里更常见,而北方诗人更容易出现宫廷、都城、礼制相关词汇。模型不懂“意境”,但它会数这些字出现了多少次,久而久之就把地域味道闻出来了。
论文还有一个很关键的结论:字符 n-gram TF-IDF 已经足够强 。当作者把古文 transformer 和 TF-IDF 结合起来时,并没有带来额外提升;而把整篇作品用分层冻结编码器再聚合后,GuwenBERT 也只是和 TF-IDF 持平,没有显著超过它。这里的“冻结编码器”意思是:先用预训练模型把文本编码,再不更新参数,只把编码结果拿来做后续分类。这个结果很扎实,也很“打脸式诚实”——不是所有地方都需要大模型出马,有时候简单统计反而更稳。
边缘还是中心?江南诗人为何更易识别?
分类结果里最耐人寻味的,不是“整体能分出来”,而是“谁最容易被分出来”。论文发现,江南等边缘或远离政治中心的地区,识别度更高;而长安、洛阳周边的中心区域,反而更容易混淆。这个现象很像现实里的口音:越是离中心远,越容易保留本地味儿;越靠近权力和文化中心,越容易被“标准化”。
这部分结果和唐代历史背景其实是对得上的。唐朝中后期,文学中心长期围绕宫廷和都城展开,中心区域的写作习惯更容易趋同;而远离中心的地区,因为文化生态、地理环境和社交圈层不同,反而更容易保留地方特色。论文把这种现象概括为“距离衰减”:离中心越远,语言越不一样。这个说法本来常见于地理语言学,放到唐诗里,居然也能成立。
更妙的是,论文并没有把“江南更容易识别”简单归结为样本更多。作者专门做了长度控制,发现即便把每位诗人的文本长度统一,结果也基本稳定。这意味着模型不是靠“谁诗多谁占便宜”,而是真抓到了风格差异。这个控制很重要,不然结果就会变成:江南不是更像江南,只是因为江南诗多,模型读得更饱。那就尴尬了。
盛唐同化与晚唐分化:地域信号如何随时间变化?
如果说空间能影响诗风,那时间当然也不会装作没看见。论文继续追问:地域信号是不是一直都一样强?答案是否定的。作者把唐诗按时代切开,发现南北差异在盛唐时期接近随机水平,而到了晚唐变得最明显。这个变化非常符合历史直觉:盛唐时期中央文化整合能力强,宫廷审美像一把大梳子,把很多地方风格都梳平了;晚唐则中央力量减弱,地方风格开始“冒头”。
这类结果最怕的就是“看起来像历史,其实是数据偏差”。所以作者又做了两个检查:一是控制文本长度,二是看不同年代的样本分布。结果显示,长度不是主因,时代和地域确实有相关性,但地域信号并没有被时代完全吞掉。也就是说,这不是“晚唐样本更少所以更容易分错”的那种低级戏码,而是真有风格变化。
更有戏剧感的是,论文发现早唐的误判几乎清一色是“南方诗人被判成北方诗人”,没有出现相反的大量错误。这个现象非常像历史上的文化吸附:早唐南方文人写作时,往往主动贴近北方和宫廷的主流话语,所以模型也把他们当成“北方口音”。这不是模型笨,恰恰说明模型把历史上的同化趋势读出来了。
模型犯错也包含深意:文学史意义的错误分析
这篇论文最有趣的地方之一,是它没有把错误当垃圾桶,而是把错误当证据。很多机器学习论文一看到误分类就开始摆手:“这个先别管,模型还在学。”但这里不一样,作者认真看了模型错在哪、为什么错,而且发现“错法”本身就很有历史解释力。
比如,中心区域常常互相混淆,不是因为模型眼神不好,而是因为这些地区在政治与文化上本来就高度接近;边缘地区更容易被识别,是因为它们保留了更多地方特色。再比如,南北差异在不同历史阶段强弱不一,说明地域风格不是静态标签,而是会被帝国结构、文化重心和文人流动不断改写的动态结果。
这里的相关系数约为0.40,显著性大概在0.09左右,严格说还不算“铁证如山”,但已经足够给出一个方向:地理越远,诗风越不一样。学术上,这种结果很像“有迹象但还需要更多样本”;文学史上,它已经足够让人开始重新审视“区域诗风”这个老话题了。
还有一个很值得点赞的点:作者没有把 transformer 说成万能钥匙。相反,实验结果告诉大家,在这种字符粒度、样本数量有限、且目标是风格统计的任务里,朴素的 TF-IDF 反而非常强。这个结论很重要,因为它提醒研究者:不是所有中文古典文本任务都需要把大模型请上神坛,有时“简单、可解释、便宜”才是最优解。
小结:可解释AI助力文学史研究
这篇论文的价值,不只是做出了一个“能猜出诗人来自哪儿”的分类器,而是证明了可解释机器学习可以成为文学史研究的好帮手。它能做的不是盖棺定论,而是提出问题:为什么江南更容易被识别?为什么盛唐更统一、晚唐更分化?为什么早唐的错误方向几乎总是南转北?这些问题,光靠直觉很难系统回答,但模型可以先把线索摆出来。
从方法上看,这篇论文也很克制:不用炫技式堆模型,而是把“字符统计 + 可解释特征 + 经典分类器”这套组合打磨得很认真。它告诉人们,研究古典中文文本时,最该优先考虑的往往不是模型越大越好,而是特征是否贴近文本结构、评价是否公平、结果是否能和历史背景对上。
如果把这项工作再往前推一步,未来可以继续做三件事:一是把地理粒度细化到更小行政区,看地域指纹是否更清晰;二是加入平仄、声韵等更贴近中古汉语的特征;三是把诗人与诗人之间的风格相似度做成网络,看看“地理相近”和“风格相近”到底是不是一回事。总之,唐诗不是只能背,还可以被计算、被比较、被重新理解。
龙迷三问
这篇论文到底解决了什么问题? 它回答的是一个很有趣的历史问题:唐诗里能不能看出诗人的地域来源。作者把这个问题变成机器学习分类任务,结果发现南北差异、中心与边缘差异、以及时代变化都能在文本中留下可检测的痕迹。
TF-IDF、GuwenBERT 这些词是什么意思? TF-IDF 是“词频-逆文档频率”,用来衡量某些字词是不是特别像某个作者;GuwenBERT 是面向古文的预训练模型,属于 transformer 家族。论文的一个重要结论是:在这项任务里,简单的字符级 TF-IDF 已经很强,GuwenBERT 并没有明显超越它。
为什么模型的“错判”也有价值? 因为错误本身会暴露历史结构。比如早唐南方诗人经常被判成北方诗人,这并不只是模型偏了,而是说明他们的写作确实更接近北方宫廷主流风格。模型的错误,反而成了文学史中的线索。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★☆☆ 这不是“发明一个新模型”的路线,而是把文学史问题做成了一个严谨、可解释的计算任务,角度新,方法稳,脑洞也够用。
实验合理度: ★★★★☆ 交叉验证、类别不平衡处理、长度控制、时代分层和误分类分析都做了,实验设计比较完整,结论也基本能互相印证。
学术研究价值: ★★★★☆ 对文学史、数字人文和可解释机器学习都有启发,尤其适合做“模型生成历史线索”的范例。
稳定性: ★★★☆☆ 作为学术分析工具很稳,但样本规模不大,标签也继承了历史数据库的噪声,离工业级部署还差得远。
适应性以及泛化能力: ★★★☆☆ 方法思路可迁移到别的古典文本,但是否有效要看文本长度、语言规范程度和标签质量。
硬件需求及成本: ★★★★☆ 以字符级特征和经典模型为主,成本不高;即便引入古文 transformer,也是在可控范围内。
复现难度: ★★★★☆ 数据与代码都给了,路径清楚,复现门槛不高;主要难点在于历史标签整理和文本清洗。
产品化成熟度: ★★☆☆☆ 更适合研究和教学场景,不太像能直接落地成产品的类型,但做数字人文工具很合适。
可能的问题: 样本偏小、标签噪声不可避免,距离衰减的显著性还不够强,后续最好补更多区域和更细粒度地理信息。
主要参考文献
[1] Harvard University, Academia Sinica, and Peking University. China Biographical Database (CBDB), 2024.
[2] Yinhan Liu et al. RoBERTa: A Robustly Optimized BERT Pretraining Approach, 2019.
[3] Nathan Mantel. The Detection of Disease Clustering and a Generalized Regression Approach, 1967.
[4] F. Pedregosa et al. Scikit-learn: Machine Learning in Python, 2011.
[5] Donald Sturgeon. The Chinese Text Project: A Dynamic Digital Library of Premodern Chinese, 2021.
[6] Ethan Yan. GuwenBERT: A Pre-trained Language Model for Classical Chinese, 2020.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
唐诗里藏着地域密码,AI也能看出个大概。想和龙哥一起继续拆解这种“看字识人”的有趣论文,来群里边聊边学~