GPT-5.4领跑SEUS:代码模型也怕版本变化
这篇论文专治“代码模型只会背最新版 API”的毛病。LibEvoBench把版本演化这件事摊开来测,结果很直接:文档一给就明显涨分,版本一说基本白搭,挺适合做代码大模型能力体检。😊
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1672 篇文章
这篇论文专治“代码模型只会背最新版 API”的毛病。LibEvoBench把版本演化这件事摊开来测,结果很直接:文档一给就明显涨分,版本一说基本白搭,挺适合做代码大模型能力体检。😊
这篇论文很实在:不跟你玩虚的,直接把金融网站的点击流拆成“可预测的嵌入”和“人能看懂的意图标签”。更妙的是,LLM 负责起名,小模型负责上生产,速度和效果都没掉链子。
金融推荐最难的地方,不是“看见了什么”,而是“没登录时到底想干啥”。这篇论文把点击流拆成可用的向量和可读的意图标签,既能提效果,又能撑解释,挺适合落地。
这篇论文最有意思的地方,不是它又造了一个代币标准,而是它试图把“仓储费、保险费、审计费”这些链下现实成本,老老实实写进链上规则里。对 RWA 和 DeFi 来说,这属于那种看起来朴素、其实很难缝好的活。
这篇工作最有意思的地方,不是又做了一个医疗问答集,而是把“医生怎么想”这件事拆成了能检查、能打分、能复核的结构。对3D胸部CT来说,这比只看最终答案靠谱多了。
这篇工作把“数据不够”这件事,硬生生掰成了“先切块、再渐进长大、最后整图开画”的扩散生成流程。更有意思的是,它不只会造图,还顺手把中间特征拿去做分割,属于一套模型干两份活。😀
这篇论文不是在“造新模型”,而是在给SKA画一张高红移分子气体的观测路线图。它最有意思的地方在于: 用低J分子谱线去补上JWST和ALMA之间那块冷气体拼图 。
CAT-Q把“训练到位才能三元化”的老路,改成了更省钱的后训练方案。512个校准样本,就想把1.58位大模型做得又稳又准,思路很硬。
这篇 PhysRAG 很像给视频生成模型塞了个“物理常识外挂”:先把训练数据洗干净,再把物理参考视频检索进来,用可学习查询提炼成真正有用的先验。结果不是只会“看起来像”,而是开始“物理上像”。
这篇 PhysRAG 很像给视频生成模型补了一本“物理常识小抄”:先把高质量物理视频筛出来,再把相关参考视频检索出来喂给模型。结果不光物理更靠谱,视觉质量也没掉链子,挺适合想看“RAG 怎么跨到视频生成里”的读者。
这篇论文盯住了射电干涉成像里最烦人的“缺频率”问题:不靠训练、不搞复杂先验,直接用非负性约束把缺失信息一点点补回来。更妙的是,它还拿 CLEAN 做了正面比较,结果看起来相当能打。🤨
这篇论文很实用,专治“摘要模型表面正常、背后作妖”。白盒能顺藤摸瓜找出毒样本,黑盒还能只靠模型行为做审计,最后连被污染的摘要习惯都能拉回来,属于防御论文里少见的“检测+修复”双保险。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球