NYU最新研究:仅用8K短数据训练,让LLM在128K长上下文推理中准确率飙升90%!
大模型在短数据上训练得再溜,一遇到超长上下文立马就“脑子一片空白”。纽约大学团队别出心裁,用“随机位置”这招,让模型在短文本训练时就能“看见”长文本的位置编码,再配合“长度课程”循序渐进的练习,仅用<8K的短数据训练,就在128K长上下文推理中准确率飙升到90%。这招堪称四两拨千斤,性价比极高!
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1660 篇文章
大模型在短数据上训练得再溜,一遇到超长上下文立马就“脑子一片空白”。纽约大学团队别出心裁,用“随机位置”这招,让模型在短文本训练时就能“看见”长文本的位置编码,再配合“长度课程”循序渐进的练习,仅用<8K的短数据训练,就在128K长上下文推理中准确率飙升到90%。这招堪称四两拨千斤,性价比极高!
“三个臭皮匠,顶个诸葛亮”在AI评审领域失灵了。Apple Research这篇论文泼了盆冷水:你花重金请来9个顶级大模型打分,以为获得群体智慧,实际上它们只用同一种声音对你说话。这是直面当前AI测评滥用的“清醒剂”。
苹果最新研究揭示了一个没人细想过的问题:收集标注时,花了钱不等于拿到了“对”的信息。KL散度和熵相关性对标注数量的要求天差地别。更扎心的是,免费的标签平滑无法取代标注员提供的“物品特有不确定性”信号。这篇文章会让你重新思考数据标注的预算分配,获得实实在在的降本增效理论基础。
爱因斯坦的引力理论在宇宙学常数(暗能量)下遇到了一个尴尬问题:引力波带走的质量究竟怎么算?这篇论文从线性引力波入手,通过巧妙的多极矩截断,不仅重新定义了de Sitter时空的“质量”,还发现了引力波扫过后独特的“记忆效应”。理论物理爱好者千万别错过,这里不仅有公式推导的严谨,也有宇宙学尺度的奇思妙想。
当AI智能体成为科研“战友”,却发现读不懂论文,这多尴尬?密歇根大学联手斯坦福、MIT等20多家机构,提出脑洞大开的协议——ARA,直接把论文从“读”的文档,变成AI可“运行”的知识包。结果振奋:PaperBench上问答准确率从72.4%飙升到93.7%,复现成功率提升7%。看来,未来科研论文真是为AI写的了!
全网断掉,没了搜索引擎和维基百科,我们怎么查资料?滑铁卢大学这篇工作给出的答案硬核且接地气—— 用蓝牙在大家手机里搭一个分布式“离线图书馆” 。CttF系统不搞天花乱坠的协议,而是让用户在断网前就缓存并互相打分,断网后再通过日常擦肩而过的那点时间交换资源。基于2.5万人真实轨迹的模拟证明,这套方案在真实部署场景下非常靠谱,比传统的流行病路由高效多了。
行星们也会“迟到早退”?基于TESS卫星前五年数据,南昆士兰大学团队首次系统梳理多行星系统凌星计时变化(TTV),发现20个存在显著“时差”的系统,其中13个此前未知。更关键的是,TESS系统偏爱2:1轨道共振,与Kepler的3:2偏好截然不同,暗示两种不同的行星形成“食谱”。想了解宇宙的“时钟”如何摆布行星?这篇就是入门指南。
当药物分子库动辄上亿候选物时,那个经典的“找最佳分子”问题瞬间变成了在浩瀚星辰中寻宝。不仅要考虑多个属性,还得在“探索”和“利用”间平衡。这篇论文提出了TTPFTS,第一个真正意义上的“随时”贝叶斯算法,无需预设预算,就能边采样边给出越来越准的帕累托最优解集。更绝的是,在9400万分子的库中,它只用了0.05%的探索量就几乎锁定了全部真实最优解,还自带一个“
在数字的禁区里,也能弹奏黎曼的乐章。这篇论文证明了非阿基米德Arakelov几何中的Bost-Gillet-Soulé公式,将复几何的神器“Green Current”带到了p-adic的世界,为算术相交理论注入新的灵魂。一句话:数学的力量,在于跨越时空的统一。
AI Agent越来越能干,但把“删库”、“开端口”这种高级权限直接交给一个会幻觉、还可能被黑客渗透的非确定性系统,这不是妥妥的定时炸弹吗?OpenKedge团队这篇论文,直接瞄准了这个“检查后执行”之间的真空地带,搞出了一个叫“Sovereign Execution Broker”的硬核边界,让Agent手里的凭证“即用即消”,从根本上堵死越权操作。一针见
生成式推荐是当下的研究热点,但如何将用户复杂的协同行为和物品语义同时注入大模型,始终是个难题。Meta这次提出G2Rec,巧妙的用了一个稀疏的物品协同图来捕捉用户行为,再用一个可扩展的“软聚类”方法自动学习出每个物品属于不同兴趣原型的概率,把难以表达的“上下文”变成了模型能轻松理解的结构化token。结果在多个数据集上全面领先,而且在线部署效果也很亮眼。读这
当多个实验站点只能发送“投票”信息,我们该如何选出最佳全局实验?简单多数投票可能大错特错!这篇论文给出了分布式贝叶斯实验设计的决策理论框架,用信息增益代替人数,融合规则逼近集中式设计,信息损失近乎为零,堪称分布式决策的“正统解法”。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球