NYU最新研究:仅用8K短数据训练,让LLM在128K长上下文推理中准确率飙升90%!
大模型在短数据上训练得再溜,一遇到超长上下文立马就“脑子一片空白”。纽约大学团队别出心裁,用“随机位置”这招,让模型在短文本训练时就能“看见”长文本的位置编码,再配合“长度课程”循序渐进的练习,仅用<8K的短数据训练,就在128K长上下文推理中准确率飙升到90%。这招堪称四两拨千斤,性价比极高!
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1655 篇文章
大模型在短数据上训练得再溜,一遇到超长上下文立马就“脑子一片空白”。纽约大学团队别出心裁,用“随机位置”这招,让模型在短文本训练时就能“看见”长文本的位置编码,再配合“长度课程”循序渐进的练习,仅用<8K的短数据训练,就在128K长上下文推理中准确率飙升到90%。这招堪称四两拨千斤,性价比极高!
让AI画个"某品牌最新概念车"?传统模型直接摆烂。小米团队提出的RS-Gen,专治AI绘图的"知识盲区"和"逻辑短路"。它像个聪明的项目经理,把复杂任务拆解成"先查资料、再想思路、最后画图",关键是不用重新训练模型,即插即用。在WISE基准上,直接把通义千问的基线模型从0.51拉到0.823,效果直逼商业闭源模型,这波开源社区赢麻了。
“三个臭皮匠,顶个诸葛亮”在AI评审领域失灵了。Apple Research这篇论文泼了盆冷水:你花重金请来9个顶级大模型打分,以为获得群体智慧,实际上它们只用同一种声音对你说话。这是直面当前AI测评滥用的“清醒剂”。
GPT-5.2这波属实翻车了。阿德莱德大学团队用标准的CNN模型就能把ECG图像分类做得稳稳的,零样本大模型却直接沦为了”随机猜测”。这篇论文不仅给火热的LLM医学应用浇了盆冷水,还提出一个生理学感知的LeadGroupECG架构,效果扎实。
当AI智能体成为科研“战友”,却发现读不懂论文,这多尴尬?密歇根大学联手斯坦福、MIT等20多家机构,提出脑洞大开的协议——ARA,直接把论文从“读”的文档,变成AI可“运行”的知识包。结果振奋:PaperBench上问答准确率从72.4%飙升到93.7%,复现成功率提升7%。看来,未来科研论文真是为AI写的了!
生成式推荐是当下的研究热点,但如何将用户复杂的协同行为和物品语义同时注入大模型,始终是个难题。Meta这次提出G2Rec,巧妙的用了一个稀疏的物品协同图来捕捉用户行为,再用一个可扩展的“软聚类”方法自动学习出每个物品属于不同兴趣原型的概率,把难以表达的“上下文”变成了模型能轻松理解的结构化token。结果在多个数据集上全面领先,而且在线部署效果也很亮眼。读这
概念瓶颈模型(CBM)一直在“可解释性”与“信息泄露”间走钢丝——模型学会用“车门”、“挡风玻璃”来识别猫?Fraunhofer研究所这篇论文用“层次化决策树”把概念空间拆成多个局部子空间,让每个预测只走自己的专属路径,从根本上堵死了信息泄露的后门!效果还跟平铺直叙的CBM不相上下。
少样本增量学习(FSCIL)一直是个“鱼和熊掌”都想兼得的难题,既要记住旧知识,又要快速学会新类别。CVPR 2026的这篇QR-Prompt,把VLM的残差特征做成“小纸条”,既稳定又灵活,在三个基准数据集上都刷了新SOTA。对于搞小样本、增量学习的朋友,这篇是必读品了。
当机器人每次重启都要重算大模型,或边缘设备LLM冷启动慢到怀疑人生,这篇论文给出了天才解法:把整个推理的“当时状态”像游戏存档一样快照,下次直接读档。FlashRT通过“执行状态胶囊”,让低延迟、小批量的边缘AI服务延迟狂降27倍,并在LLM、TTS、机器人策略上统一了这套机制。简单说,就是让AI推理变得像按快门一样快。
让大模型第一步就做对,这要求有点高。但如果允许它错几次,再一步步修正呢? 西北大学联手亚马逊AGI提出的REVES框架,精准点出了当前“测试时扩展”技术的核心瓶颈——训练与推理的“步数”不匹配。它巧妙地通过把“接近正确”的错解转化为修正样本,用单步强化学习高效地训练模型学会自我纠错,在代码、数学上全面领先,还用4B模型在圆球填充任务上追平了8B系统的SOTA
长视频问答一直是个“贵”且“难”的活儿——处理一小时视频,光视觉token就超200万。北卡大学夏洛特分校的TIMEPROVE,提供了极其优雅的解决思路:先用轻量级的动作检测模块“侦察”出关键证据片段,再只把这些精挑细选的短片段送给VLM做“终审”。结果准确率涨了7.3%,VLM调用次数锐减75%,推理成本暴跌93%!这简直就是给LVQA这个“烧钱”领域的一
继2026年6月聊过AI智能体安全评估之后,这次新加坡国立大学团队带来更猛的干货:不是让LLM当黑盒猎头,而是让它把“觉得安全”的判断写成可执行的断言,再用模糊测试来挑战这些断言。结果?在DARPA的AIxCC基准上比顶尖智能体多发现34%-63%的漏洞,还挖出了22个真实世界的0-day!这才是AI安全审计该有的样子。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球