LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1655 篇文章

PaperDaily 数据库收录 论文拆解 12858 研究思路 385 AI 资讯 210 开源项目 164 科研招聘 128 学习资料 8 热点主题 503 论文成功模式 1625

标签:大语言模型

共 322 篇
NYU最新研究:仅用8K短数据训练,让LLM在128K长上下文推理中准确率飙升90%!
大模型与智能体

NYU最新研究:仅用8K短数据训练,让LLM在128K长上下文推理中准确率飙升90%!

大模型在短数据上训练得再溜,一遇到超长上下文立马就“脑子一片空白”。纽约大学团队别出心裁,用“随机位置”这招,让模型在短文本训练时就能“看见”长文本的位置编码,再配合“长度课程”循序渐进的练习,仅用<8K的短数据训练,就在128K长上下文推理中准确率飙升到90%。这招堪称四两拨千斤,性价比极高!

小米最新研究:RS-Gen让AI绘图告别“翻车”,逻辑推理+实时搜索,效果直逼闭源
视觉与图像

小米最新研究:RS-Gen让AI绘图告别“翻车”,逻辑推理+实时搜索,效果直逼闭源

让AI画个"某品牌最新概念车"?传统模型直接摆烂。小米团队提出的RS-Gen,专治AI绘图的"知识盲区"和"逻辑短路"。它像个聪明的项目经理,把复杂任务拆解成"先查资料、再想思路、最后画图",关键是不用重新训练模型,即插即用。在WISE基准上,直接把通义千问的基线模型从0.51拉到0.823,效果直逼商业闭源模型,这波开源社区赢麻了。

密歇根等20+机构新作:告别PDF论文,让AI智能体直接操作科研成果,问答准确率暴涨至93.7%
大模型与智能体

密歇根等20+机构新作:告别PDF论文,让AI智能体直接操作科研成果,问答准确率暴涨至93.7%

当AI智能体成为科研“战友”,却发现读不懂论文,这多尴尬?密歇根大学联手斯坦福、MIT等20多家机构,提出脑洞大开的协议——ARA,直接把论文从“读”的文档,变成AI可“运行”的知识包。结果振奋:PaperBench上问答准确率从72.4%飙升到93.7%,复现成功率提升7%。看来,未来科研论文真是为AI写的了!

Meta最新研究:用“软聚类”给物品画像,生成式推荐效果大涨!
大模型与智能体

Meta最新研究:用“软聚类”给物品画像,生成式推荐效果大涨!

生成式推荐是当下的研究热点,但如何将用户复杂的协同行为和物品语义同时注入大模型,始终是个难题。Meta这次提出G2Rec,巧妙的用了一个稀疏的物品协同图来捕捉用户行为,再用一个可扩展的“软聚类”方法自动学习出每个物品属于不同兴趣原型的概率,把难以表达的“上下文”变成了模型能轻松理解的结构化token。结果在多个数据集上全面领先,而且在线部署效果也很亮眼。读这

Fraunhofer研究所新作:用「概念流树」替代扁平瓶颈,信息泄露减少40%!
视觉与图像

Fraunhofer研究所新作:用「概念流树」替代扁平瓶颈,信息泄露减少40%!

概念瓶颈模型(CBM)一直在“可解释性”与“信息泄露”间走钢丝——模型学会用“车门”、“挡风玻璃”来识别猫?Fraunhofer研究所这篇论文用“层次化决策树”把概念空间拆成多个局部子空间,让每个预测只走自己的专属路径,从根本上堵死了信息泄露的后门!效果还跟平铺直叙的CBM不相上下。

CVPR 2026接收!QR-Prompt把残差变提示,少样本增量学习性能飙升
视觉与图像

CVPR 2026接收!QR-Prompt把残差变提示,少样本增量学习性能飙升

少样本增量学习(FSCIL)一直是个“鱼和熊掌”都想兼得的难题,既要记住旧知识,又要快速学会新类别。CVPR 2026的这篇QR-Prompt,把VLM的残差特征做成“小纸条”,既稳定又灵活,在三个基准数据集上都刷了新SOTA。对于搞小样本、增量学习的朋友,这篇是必读品了。

FlashRT开源:27倍加速,边缘AI推理告别“重计算”,秒变“快照恢复”
视觉与图像

FlashRT开源:27倍加速,边缘AI推理告别“重计算”,秒变“快照恢复”

当机器人每次重启都要重算大模型,或边缘设备LLM冷启动慢到怀疑人生,这篇论文给出了天才解法:把整个推理的“当时状态”像游戏存档一样快照,下次直接读档。FlashRT通过“执行状态胶囊”,让低延迟、小批量的边缘AI服务延迟狂降27倍,并在LLM、TTS、机器人策略上统一了这套机制。简单说,就是让AI推理变得像按快门一样快。

西北大学&亚马逊AGI最新研究:让大模型学好“纠错”,推理能力暴涨,4B模型打趴8B!
大模型与智能体

西北大学&亚马逊AGI最新研究:让大模型学好“纠错”,推理能力暴涨,4B模型打趴8B!

让大模型第一步就做对,这要求有点高。但如果允许它错几次,再一步步修正呢? 西北大学联手亚马逊AGI提出的REVES框架,精准点出了当前“测试时扩展”技术的核心瓶颈——训练与推理的“步数”不匹配。它巧妙地通过把“接近正确”的错解转化为修正样本,用单步强化学习高效地训练模型学会自我纠错,在代码、数学上全面领先,还用4B模型在圆球填充任务上追平了8B系统的SOTA

仅用7%成本就吊打全场?北卡大学提出TIMEPROVE,让长视频问答学会“先找证据再说话”
视觉与图像

仅用7%成本就吊打全场?北卡大学提出TIMEPROVE,让长视频问答学会“先找证据再说话”

长视频问答一直是个“贵”且“难”的活儿——处理一小时视频,光视觉token就超200万。北卡大学夏洛特分校的TIMEPROVE,提供了极其优雅的解决思路:先用轻量级的动作检测模块“侦察”出关键证据片段,再只把这些精挑细选的短片段送给VLM做“终审”。结果准确率涨了7.3%,VLM调用次数锐减75%,推理成本暴跌93%!这简直就是给LVQA这个“烧钱”领域的一

告别黑箱审计:CODE-AUGUR如何让LLM的安全判断变得可验证、可复用
大模型与智能体

告别黑箱审计:CODE-AUGUR如何让LLM的安全判断变得可验证、可复用

继2026年6月聊过AI智能体安全评估之后,这次新加坡国立大学团队带来更猛的干货:不是让LLM当黑盒猎头,而是让它把“觉得安全”的判断写成可执行的断言,再用模糊测试来挑战这些断言。结果?在DARPA的AIxCC基准上比顶尖智能体多发现34%-63%的漏洞,还挖出了22个真实世界的0-day!这才是AI安全审计该有的样子。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球