LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12820 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:大语言模型

共 319 篇
阿里USB基准发布:5274条真实购物轨迹,支持多轮强化学习
大模型与智能体

阿里USB基准发布:5274条真实购物轨迹,支持多轮强化学习

电商推荐系统想离线做策略评估,最缺的就是一个“真实买家”。阿里和人大等团队提出的RecVerse,让模型真的去看截图“逛街”,还配了套三层记忆和轨迹级奖励,模拟出来的购物行为既像真人一样会犹豫比较,又能买到用户真想买的东西,顺手开源了5千多条真实轨迹的交互式基准。做推荐、做用户增长的同学值得一读。

大模型零遗忘新范式Brainstacks:医疗提问97%路由到数学堆栈
大模型与智能体

大模型零遗忘新范式Brainstacks:医疗提问97%路由到数学堆栈

这篇论文最有冲击力的地方,不是零遗忘的堆栈设计本身,而是那个反常识的发现:医疗提示在97%的情况下会路由到聊天+数学堆栈——它们训练时根本没见过医疗数据。这说明微调注入的是可迁移的认知原语,而不是领域知识。思考方式被当作"能力"打包,这件事值得所有做微调的人停下来想想。

上海交大浙大开源OdinEval:冷门语言修复实测,Kimi-K3成功率仅66.7%
大模型与智能体

上海交大浙大开源OdinEval:冷门语言修复实测,Kimi-K3成功率仅66.7%

大模型修代码的评测大多扎堆Java和Python,冷门系统编程语言几乎没人管。上海交大、浙大这篇OdinEval把目光瞄向Odin语言,用168个真实issue把6个大模型拉出来遛了一圈,还给出了一套可复现性拉满的评测协议。想看看Kimi-K3、GLM-5.2这些模型在陌生语言面前谁更能打,这篇必读。

8358篇阿尔巴尼亚新闻实测:本地LLM也能精准追踪媒体语气
大模型与智能体

8358篇阿尔巴尼亚新闻实测:本地LLM也能精准追踪媒体语气

低资源语言的NLP工具一直是老大难,这篇来自地拉那大学的论文直接用本地Gemma 4搭了一条媒体偏见分析流水线,在8358篇阿尔巴尼亚语新闻上把人物实体召回率做到70.3%。更妙的是提示词对比实验:严格校验虽然消灭了标签不一致,但覆盖率几乎腰斩。看完只想说,工程里没有万能的prompt,只有合适的取舍。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球