清华SCALECUA把电脑智能体拉到68.7%,开源模型新纪录
这篇论文最值钱的不是单点技巧,而是把电脑智能体最卡脖子的三件事一次打通:题不够、采样不准、训练太慢。清华团队把可验证任务合成、前沿采样和视觉上下文分割拼成一条流水线,直接把开源模型推到 68.7%。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文最值钱的不是单点技巧,而是把电脑智能体最卡脖子的三件事一次打通:题不够、采样不准、训练太慢。清华团队把可验证任务合成、前沿采样和视觉上下文分割拼成一条流水线,直接把开源模型推到 68.7%。
这篇论文最有意思的地方,不是“翻译”本身,而是把古手稿识别、现代越南语生成和偏好对齐揉成一个端到端问题。PPO、DPO、KTO三种RLHF路线同台对决,结果也很诚实:DPO在多数翻译质量指标上最稳,PPO更偏覆盖,KTO则保留了自己的性价比。
语音微调这件事,论文里常被写成“方法更强了”,但这篇直接泼了一盆冷水:很多提升其实是“检查点碰巧对上了”。9个预训练模型、8种SFT配置、3个任务一起拉出来比,结论很扎实,也很扎心。
这篇论文不讲虚的,直接盯住工业机械臂最现实的问题:显存不够、全量微调太贵、LoRA到底能不能顶住。结果很有意思,r=32 基本就到头了。
这篇论文很实在:不追求大模型堆参数,而是盯着视频通话最真实的痛点——带宽不够、画面糊、还得实时。它用少量人脸帧就能快速训练一个CPU可跑的增强模型,属于“能落地”的那种小聪明。
这篇论文把“蒸馏”从一次性教学,改成了连续换老师的长期训练。更有意思的是,外部数据既能帮学生学到新东西,也可能顺手把旧知识冲掉,SE2D就是专门来收拾这个烂摊子的。
Muon这类优化器经常被讲得很玄,这篇论文反而把话说得很人话:它像训练中的“隐式残差连接”。两阶段线性实验虽然简单,但能把“局部更慢、下游更快”这件事讲清楚,值得读。
这篇论文最有意思的地方,不是“又测了一次脉冲星”,而是把原本极其耗算力的磁场反演,硬生生改成了神经网络加速的贝叶斯推断。速度上去了,结论反而更诚实:后验很宽,说明这题远没有想象中那么好答。
Transformer 一直把“记忆”和“预测”塞进同一条链路里,像让一个人一边背台词一边写剧本。康奈尔这篇论文直接把两件事拆开,结果是更低损失、更好泛化,而且推理几乎不涨成本,思路很硬。
这篇论文最有意思的地方,不是把模型从头再训一遍,而是拿一个已经后训练好的111B多语模型,靠三步适配把“会说话”升级成“会办事”。更关键的是,它把韩语回答、英语推理、工具调用和单卡部署这几件原本互相打架的事,硬是捏到了一起。
多模态大模型最烦的,不是不会想,而是训练时偷看答案、推理时却只能裸奔。AMVL直接把这个“作弊窗口”堵上,用双向KL同时管住先验和后验,思路很硬,实验也够实在。
热成像检测最烦的不是“看不见”,而是“看见了也不知道它叫什么”。这篇 Thermal-Det 直接把开放词汇、语言引导和跨模态蒸馏塞进热成像里,还真把零样本检测做出了像样的结果,属于能落到真实场景的那种活儿。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球