LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1672 篇文章

PaperDaily 数据库收录 论文拆解 12899 研究思路 385 AI 资讯 267 开源项目 164 科研招聘 131 学习资料 8 热点主题 509 论文成功模式 1625

最新文章

共 1672 篇
西北大学&亚马逊AGI最新研究:让大模型学好“纠错”,推理能力暴涨,4B模型打趴8B!
大模型与智能体

西北大学&亚马逊AGI最新研究:让大模型学好“纠错”,推理能力暴涨,4B模型打趴8B!

让大模型第一步就做对,这要求有点高。但如果允许它错几次,再一步步修正呢? 西北大学联手亚马逊AGI提出的REVES框架,精准点出了当前“测试时扩展”技术的核心瓶颈——训练与推理的“步数”不匹配。它巧妙地通过把“接近正确”的错解转化为修正样本,用单步强化学习高效地训练模型学会自我纠错,在代码、数学上全面领先,还用4B模型在圆球填充任务上追平了8B系统的SOTA

北卡罗来纳大学夏洛特分校最新研究,ACE模块让VLM调用减少75%
视觉与图像

北卡罗来纳大学夏洛特分校最新研究,ACE模块让VLM调用减少75%

长视频问答(LVQA)一直是个“烧钱”的活,把一小时的视频全喂给大视觉模型,光是token就能上百万。而TIMEPROVE给出的策略很聪明:先派轻量级的动作检测器去“探路”,生成几个高概率的答案假设,最后才让大模型去“拍板”验证。结果呢?效果涨了7.3%,成本却降了93%。这种“先猜后验”的思路,值得每个做视频理解的人关注。

仅用7%成本就吊打全场?北卡大学提出TIMEPROVE,让长视频问答学会“先找证据再说话”
视觉与图像

仅用7%成本就吊打全场?北卡大学提出TIMEPROVE,让长视频问答学会“先找证据再说话”

长视频问答一直是个“贵”且“难”的活儿——处理一小时视频,光视觉token就超200万。北卡大学夏洛特分校的TIMEPROVE,提供了极其优雅的解决思路:先用轻量级的动作检测模块“侦察”出关键证据片段,再只把这些精挑细选的短片段送给VLM做“终审”。结果准确率涨了7.3%,VLM调用次数锐减75%,推理成本暴跌93%!这简直就是给LVQA这个“烧钱”领域的一

机器人视觉新范式:不再看图识字,而是看“手”学动作
视觉与图像

机器人视觉新范式:不再看图识字,而是看“手”学动作

传统视觉编码器(如CLIP、DINOv2)再强大,也是用猫狗图片、风景照训练的,它根本不知道“抓杯子”需要看哪儿。这篇UC Berkeley和NVIDIA的CAIP,用地表最强的“人类第一人称操作视频”(Ego4D等)作为训练数据,让视觉编码器学会了看“手”和“物体接触点”。这招“用人类手部姿态代理机器人动作”,直接让灵巧操作任务成功率飙升30%,而且抗干扰

四足机器人跑酷破纪录!SWAP用对称性原理,一跃2.13米,登顶1.63米
视觉与图像

四足机器人跑酷破纪录!SWAP用对称性原理,一跃2.13米,登顶1.63米

机器人的左右腿,是不是总被当成两套独立的程序在学?这篇论文的作者们也这么想,于是他们干脆把“对称性”这个物理常识硬塞进了神经网络。结果咋样?一台重达72公斤的机器人,在美国国家航空航天局(NASA)的JPL实验室里也跑不出这么猛的数据——1.63米高台一跃而上,2.13米宽的鸿沟轻松跨过,这波操作,真把四足跑酷玩成了物理定律的炫技。

排名也有偏见?巴西学者提出SMAA-Fair,给多准则决策中的排名加上“公平滤镜”
大模型与智能体

排名也有偏见?巴西学者提出SMAA-Fair,给多准则决策中的排名加上“公平滤镜”

当你在多准则决策中用SMAA方法计算排名时,有没有想过这个排名可能对某些群体“偏心”?巴西学者提出的SMAA-Fair正是来解决这个问题的。它不改变你的模型,只调整每个模拟排名对最终结果的“投票权重”——排名越公平,权重越高。简单有效,思路清奇。

告别黑箱审计:CODE-AUGUR如何让LLM的安全判断变得可验证、可复用
大模型与智能体

告别黑箱审计:CODE-AUGUR如何让LLM的安全判断变得可验证、可复用

继2026年6月聊过AI智能体安全评估之后,这次新加坡国立大学团队带来更猛的干货:不是让LLM当黑盒猎头,而是让它把“觉得安全”的判断写成可执行的断言,再用模糊测试来挑战这些断言。结果?在DARPA的AIxCC基准上比顶尖智能体多发现34%-63%的漏洞,还挖出了22个真实世界的0-day!这才是AI安全审计该有的样子。

40%任务效率提升!重庆大学提出ExS2D:零双臂数据训练双臂机器人
视觉与图像

40%任务效率提升!重庆大学提出ExS2D:零双臂数据训练双臂机器人

想让家里的扫地机器人帮你搬桌子?想给它找俩搭子?这篇重庆大学的新研究带来一个“骚操作”:让你的单臂机器人不用练习,直接点亮“双打”天赋。不需要昂贵耗时的双臂演示数据,它们通过一个精巧的层次化框架,就让机器人自己学会左右开弓。一句话总结:白嫖单臂数据,通吃双臂任务。🤚

被引26489次!蒙特利尔大学提出RNN编码器-解码器:给机器翻译装上“语义引擎”
大模型与智能体

被引26489次!蒙特利尔大学提出RNN编码器-解码器:给机器翻译装上“语义引擎”

这篇论文是NLP领域圣经级的存在,引用数高达26489次!它提出的RNN编码器-解码器架构,以及其中巧妙的门控隐藏单元,直接为后来风靡全球的seq2seq模型和GRU铺平了道路。如果你想理解机器翻译乃至整个序列生成任务的基石,这篇2014年的经典之作绝对不容错过。

流感预测大PK:17个模型“华山论剑”,混合专家模型夺冠!
大模型与智能体

流感预测大PK:17个模型“华山论剑”,混合专家模型夺冠!

流感预报影响万千人健康,从ARIMA到PatchTST再到各种大模型,谁才是预测流感传播的“预言帝”?弗吉尼亚大学这篇论文,用17个模型在真实场景下进行了1-4周预测大PK。结果很有意思:混合专家模型稳居C位,而用大语言模型做时间序列预测,这次表现真是不太能打... 一起来看看到底谁是C位,谁又该回炉重造吧。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球