LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12823 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:大语言模型

共 319 篇
RAG+LLM修复历史文档,准确率从13%冲到70%,专家都说好
视觉与图像

RAG+LLM修复历史文档,准确率从13%冲到70%,专家都说好

历史文档修复一直是NLP领域的硬骨头,尤其是那些需要外部知识才能确定的古代人名、地名。这篇来自韩国江原大学的工作,巧妙地将RAG与大模型微调结合,不仅让命名实体恢复准确率从个位数跃升至38%,还通过了人类专家的实操检验。对于想做RAG落地或古籍数字化的朋友,值得一读。

RAG+LLM专治古卷专有名词,Qwen3微调效果超Gemini
视觉与图像

RAG+LLM专治古卷专有名词,Qwen3微调效果超Gemini

历史文档修复一直是难题,尤其涉及专有名词时连GPT-5都容易翻车。韩国江原大学这篇论文把RAG和LLM结合,让模型在修复时自动“查资料”,在朝鲜王朝档案上命名实体恢复率提升近一倍,甚至超过了Gemini-2.5-Pro。代码、模型全部开源,实用价值极高。

RAG修复古籍:韩国团队让GPT-5.1在命名实体恢复上惨败
视觉与图像

RAG修复古籍:韩国团队让GPT-5.1在命名实体恢复上惨败

历史文档像一本被水泡过的《永乐大典》,人名地名糊成一片,传统MLM模型只能干瞪眼。韩国国立江原大学的团队祭出大招——ARI让大语言模型学会“翻书查资料”,用RAG精准找回那些被岁月抹去的名字。在朝鲜王朝实录的修复中,ARI-32B(Qwen3 32B微调版)在命名实体恢复上直接把GPT-5.1按在地上摩擦,效果翻倍。这不仅是个技术活,更像是在帮AI配一副“历

AI · PAPER
大模型与智能体

多伦多大学新基准:AI在复杂任务中准确率暴跌33%,上下文管理是致命短板

最近大家都在追怎么让AI“长记忆”,但你有没想过:就算记忆再长,记错关键计算的中间结果、或者被无关干扰冲昏头脑,照样白搭?多伦多大学联合Vector Institute的新工作ArbiGraph,就用一套可验证的任务图,精准拷打了语言代理在复杂流程中的“上下文管理”能力。结果有点扎心:Qwen3.5-27B单做一题数学题94.5%正确,但放进带分支的依赖链里

GPT-4.1“扮演”美国选民:8/9州预测正确,医疗意见准确率0.94,但偏见暗藏!
大模型与智能体

GPT-4.1“扮演”美国选民:8/9州预测正确,医疗意见准确率0.94,但偏见暗藏!

继2026年6月推送“AI投资天团”之后,龙哥又挖到一篇角色模拟领域的硬核评估论文——GPT-4.1扮演美国选民预测大选,8/9州全中!还能预测你对孩子打疫苗的态度(准到94%)。但别急着欢呼,深入一看,偏见比数据更顽固。这篇工作把角色模拟的“高光”和“暗面”一起扒了个干净,值得每一位关心AI可控性的同学细读。

72B参数大模型当导师,无需人工标注,概念学习零门槛
大模型与智能体

72B参数大模型当导师,无需人工标注,概念学习零门槛

手术台上,医生盯着质谱仪实时反馈的代谢数据,问AI“为什么判断这里是肿瘤?”——以前只能得到一个黑盒概率。现在皇后大学团队让AI学会自己发现代谢概念,甚至能用知识图谱解释“看到了异常的氨基酸信号”。关键是不需要人工标注概念,这招解决了质谱分析的一大痛点。方法新、实验实、还给出术中案例,值得关注。

WPI携手ChatGPT-5.6:奇环香农容量下界刷新,C7超3.258
大模型与智能体

WPI携手ChatGPT-5.6:奇环香农容量下界刷新,C7超3.258

一篇让数学界看到AI潜力的工作:用ChatGPT-5.6找到了比传统启发式更大的独立集,把C7香农容量下界又推高了那么一丢丢。数字虽小,意义不小——LLM正在学会做真正的数学发现。尽管本地搜索算法和模拟退火苦战三月未果,LLM仅靠对话就突破了关键壁垒。这种"聊天式科研"的范式,会不会成为未来的新常态?

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球