LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12820 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:模型训练

共 155 篇
告别脏数据!亚马逊开源Data Turnstile,让0.6B模型逼近7倍大模型
视觉与图像

告别脏数据!亚马逊开源Data Turnstile,让0.6B模型逼近7倍大模型

这篇论文切中了AI智能体落地的一个真痛点:小模型工具调用能力弱,但可靠数据既贵又脏。Data Turnstile把整段对话拆成带校验的角色化有向无环图,用开源权重模型就能批量产出高质量函数调用数据。0.6B微调后BFCL直逼7倍大的Qwen3-4B,多轮电信任务1.7B直接超越32B——数据质量对小模型而言,就是胜负手。

AI · PAPER
大模型与智能体

Meta推出ROCS:推荐系统推理效率提升3倍,零质量损失

推荐系统推理常需对数百候选跑完整模型,存在大量重复计算。Meta的ROCS拆掉这种结构性冗余:延迟交互、请求侧只算一次,配合GPU内核优化,检索QPS最高提升3倍,排序阶段用省下的算力换模型质量。该方案已在Meta广告和自然内容数十个模型上真实部署,绝非纸上谈兵。

AI · PAPER
视觉与图像

文生视频最难啃的骨头,被cIPO用"重建误差"啃下来了

文生视频最讨厌的就是中间有几帧突然崩坏,而现有DPO类偏好优化连"错题"都找不准。快手Kling团队这篇cIPO,直接从模型自己的去噪重建误差里抠出偏好信号,把优化火力集中到高错误时间窗口,不用人工标注、不用外部奖励模型,MotionBench上Forensic从0.830涨到0.876,思路清奇且工程上很容易复现。

AI · PAPER
大模型与智能体

告别EBM训练难!PTT沿训练轨迹搭天梯,成本追平PCD

能量模型(EBM)一直是个"难啃的硬骨头":理论优雅,却老困在采样慢、训练不稳的泥潭里。这篇论文提出的并行轨迹回火(PTT)算法,直接沿训练轨迹搭"副本天梯"保持平衡采样,计算成本还能追平PCD——在伊辛模型、基因组、蛋白质等多类科学数据上全面逆袭。对想用可解释生成模型做科学发现的朋友,这波操作值得关注。

AI · PAPER
大模型与智能体

测试时计算还能这么省?中山大学SVR只需一半token精度反超oracle

数学考试里有个经典场面:学霸写完就交卷,学渣越改越错。大模型推理也有这毛病——简单题算力浪费,难题越修越歪。中山大学这篇新论文,教模型“自我检查”:有把握才交卷,没底就再改一轮。结果平均2.99轮推理,精度反而超过固定10轮,还省了一大半token。这招龙哥看了直呼内行!

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球