NeurIPS 2026新研究:复读10%数据,344M模型算力竟白烧33%
这篇论文专门盯住一个很现实的问题:训练语料里那些“删不干净的重复”,到底会怎么偷走算力。它不只说“重复不好”,还给出了最伤人的重复区间、模型规模趋势,以及一个能把损失翻成算力浪费的尺子,挺实用。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1655 篇文章
这篇论文专门盯住一个很现实的问题:训练语料里那些“删不干净的重复”,到底会怎么偷走算力。它不只说“重复不好”,还给出了最伤人的重复区间、模型规模趋势,以及一个能把损失翻成算力浪费的尺子,挺实用。
这篇论文把“写报告”这件事拆成了两步:先把医生的自由文本洗成结构化标签,再让模型按规矩自动生成。别看它是医学场景,思路其实很通用,尤其适合那些“数据不多、标签还乱”的硬核任务。
在线强化学习最怕什么?不是不会学,而是学着学着突然跑偏。GEOALIGN抓住“高分但方向不对”的rollout,直接在潜空间里做体检,数学推理和对齐任务都更稳了。
这篇论文最有意思的地方,是把“基础模型很强但不好验”这个老大难,拆成了一个能落地的工程问题。大模型负责看图、听话、想任务,小安全模块负责把关,形式化验证只盯住后者,思路很干净。
这篇论文抓住了在线RL最烦人的毛病:明明奖励不低,训练却像坐过山车。GEOALIGN不跟奖励硬刚,而是从“方向”下手,专门揪出那些高分但带偏全局更新的rollout,思路相当清爽。
这篇论文把强化学习后的大模型工具调用,拆成了可定位、可操控、还能“溢出”的内部特征。更有意思的是,单个 A 专属特征就能把工具调用能力直接拉满,机制味儿很浓。
视频里常常不止一个事件,硬把它们当成“一锅粥”来分割,模型就容易看花眼。EVIS干脆先把视频拆成简单事件,再一段一段对齐文本,思路挺顺手。
这篇论文不跟语法错误死磕,而是专门盯住“看起来没毛病、其实物理上不对劲”的语义Bug。Aalto University用知识图谱给小模型喂规则,还让它输出补丁而不是整段重写,工程师看一眼就能决定要不要采纳。
这篇是 IWSLT 2026 指令跟随赛道的实战型提交,重点不在“花活”,而在“怎么把长语音稳稳切开、别让模型开始胡说八道”。固定 30 秒切分拿到最优 HIFS,幻觉还主要是重复插入,结论很接地气。
这篇论文专治“代码模型只会背最新版 API”的毛病。LibEvoBench把版本演化这件事摊开来测,结果很直接:文档一给就明显涨分,版本一说基本白搭,挺适合做代码大模型能力体检。😊
这篇论文很实在:不跟你玩虚的,直接把金融网站的点击流拆成“可预测的嵌入”和“人能看懂的意图标签”。更妙的是,LLM 负责起名,小模型负责上生产,速度和效果都没掉链子。
金融推荐最难的地方,不是“看见了什么”,而是“没登录时到底想干啥”。这篇论文把点击流拆成可用的向量和可读的意图标签,既能提效果,又能撑解释,挺适合落地。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球