GPT-4o当裁判,Qwen2.5答得更靠谱,背后其实是一张评分表
奖励信号怎么给,才能让大模型在开放域问答里真正学会“有理有据、条理清晰”?苹果这篇最新论文把笼统的偏好打分换成了多维评分细则,效果直接涨了6.5%。路子够巧,值得一读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
奖励信号怎么给,才能让大模型在开放域问答里真正学会“有理有据、条理清晰”?苹果这篇最新论文把笼统的偏好打分换成了多维评分细则,效果直接涨了6.5%。路子够巧,值得一读。
继大模型推理能力在数学、代码领域大杀四方之后,法国索邦大学与SYSTRAN团队把「思考」带进了机器翻译:让模型先从检索到的相似示例里精准切出可复用的平行片段,再动笔翻译。实验覆盖6种语言16个领域,BLEU、COMET与MetricX全面超越传统k-shot与草稿式推理,思路清奇且落地性强,值得每一位NLP从业者细读。
当Claude Code、Codex在代码世界里大杀四方时,GUI软件依然是智能体的"最后屏障"。上海交大与BIGAI提出ASIL,用结构化JSON观测+语义化代码动作替代截图点击,让GPT-5.4在380个任务上拿下81.6%的成功率,而同样的任务截图控制只有6.6%。一句话操作就能完成截图控制15次点击都完不成的活,这可能是智能体交互的一次范式革命。
测试时扩展很香,但反复采样是真烧钱。这篇论文给出一个反直觉的省钱思路:把小模型犯过的错变成提示词,让大模型一次解码就能绕开坑。单次生成、零额外推理开销,还在Qwen、Llama两大系列上全面超越多次采样基线,值得所有做LLM推理的读者花五分钟看看。
贝叶斯,概率论里那个如雷贯耳的名字。在医疗诊断、法律论证、科学推理这些高风险场景里,一个AI系统面对新证据时,应该理性地更新自己对某个结论的相信程度——这正是贝叶斯定理干的事。
咱们直接进入正题。当下做企业级AI Agent,说白了就是在跟各种API打交道:日历、项目管理、数据库、通信软件……Agent要干活,就得学会调用这些外部工具。
传统遗忘评测只问「忘没忘」,不问「能不能被硬撬开」。巴伊兰大学这篇论文把两件事同时做了:一是用边界知识检查误伤,二是拿越狱攻击检验假遗忘。看完实验只想说:不少模型连「表面失忆」都算不上,顶多是「装死」。
如何判断大模型提出的科研设想靠不靠谱?北大、华为等机构给出一个硬核标准:让模型先写清楚,什么观察结果能证明它自己错。全新Lit2Test基准用六字段契约把可证伪性变成可检验的文本属性,在1200个标准对、2400次盲评下排出GPT-5.2 > Claude Sonnet 4.6 > GLM-5 > DeepSeek-V3.2的严格名次,人类一致率87.2%。
事件抽取模型一出自家门就迷路?德国DFKI与奥尔登堡大学联合提出统一多域多任务生成框架:给T5加上领域指示和任务提示词,单模型就能横跨网络安全、生物医学、新闻等6大领域做事件抽取,多域联合训练还让多个数据集性能不降反升,这种"一个模型通吃天下"的玩法,值得认真聊聊。
黑盒大模型在物种分类这类层级推理任务中,经常“嘴硬”但心里没底。这篇来自Vector Institute与Guelph大学的工作,用开源工具LLM提取代理特征,训练轻量监督估计器,把全局阈值下AUROC从0.57拉到0.80,为“该信谁、该拒谁”提供了可落地的判断框架。
大模型测价值观,用问卷、二选一、自由发挥能得出三个不同结论,那测了个寂寞?STONIC用5,144个共享场景和35个模型配置做了一次教科书级的测量审计——既有行为一致性证据,也有“自答偏好”这个反直觉发现,做LLM对齐评估的朋友值得细读。
MoE模型推理被显存卡脖子?SPICE给出「预取+替代+异构计算」组合拳,在DeepSeek-V2-Lite和Qwen2-57B-A14B上实现最高3.12倍加速,精度损失仅3%左右。系统优化能做到这个份上,值得花五分钟读一读。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球