LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12820 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:大语言模型

共 319 篇
让AI学会货比三家?普林斯顿这个基准至今无人超越
大模型与智能体

让AI学会货比三家?普林斯顿这个基准至今无人超越

这篇被引1300+次的开创性工作,来自普林斯顿大学。WebShop用118万件真实商品和1.2万条人工指令,把“语言智能体”的评测从玩具级任务搬进接近真实的电商场景——AI要自己读懂需求、搜索商品、挑选项、下单。更难得的是,训练好的智能体能零样本迁移到真实Amazon和eBay,是语言grounding方向绕不开的经典基准。

浙大开源24小时心电基准:GPT-5也翻车,微调后准确率99.7%
视觉与图像

浙大开源24小时心电基准:GPT-5也翻车,微调后准确率99.7%

24小时动态心电(Holter)是诊断心律失常的金标准,但多模态大模型在超长时序信号面前几乎“失灵”。浙大等团队开源Holtercare-Bench基准与Holtercare-23K数据集,用信号-视频-文本三模态对齐,让GPT-5、Qwen3-VL等模型首次系统性接受“心电马拉松”考验——微调后时序定位准确率飙到99.7%,差距比想象中更大。

单次采样效果优于PPO/GRPO厦大&南洋理工新方法大涨15个点
大模型与智能体

单次采样效果优于PPO/GRPO厦大&南洋理工新方法大涨15个点

智能体强化学习正处在大模型后训练的核心位置,但PPO太贵、GRPO又存在信用分配短板。本文提出SAPO,用一条自回归流同时搞定策略与价值估计,在ALFWorld和WebShop上比PPO/GRPO平均涨15.1/12.1个百分点,还省掉独立critic、提速33.2%。一句话:值估计的便宜和单采样的高效,这次全都要。

哈佛最新开源:147万份百年报纸,榨出163亿token公共数据集
视觉与图像

哈佛最新开源:147万份百年报纸,榨出163亿token公共数据集

这可能是今年最"考古"的AI基础设施工作:哈佛联手波士顿公共图书馆,把1795到1930年的147万份报纸扫描件,变成163亿token的干净文本。更难得的是,整套流水线设计成工作站级硬件就能跑,租服务器全程只要约2.5万美元——相比云端OCR动辄几十万美元的报价,这性价比简直离谱。对做数据工程、LLM预训练和数字人文的人来说,这篇值得细读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球