CORTEX来了:3D胸部CT推理首次变成可验证结构
这篇工作最有意思的地方,不是又做了一个医疗问答集,而是把“医生怎么想”这件事拆成了能检查、能打分、能复核的结构。对3D胸部CT来说,这比只看最终答案靠谱多了。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1655 篇文章
这篇工作最有意思的地方,不是又做了一个医疗问答集,而是把“医生怎么想”这件事拆成了能检查、能打分、能复核的结构。对3D胸部CT来说,这比只看最终答案靠谱多了。
CAT-Q把“训练到位才能三元化”的老路,改成了更省钱的后训练方案。512个校准样本,就想把1.58位大模型做得又稳又准,思路很硬。
这篇论文很实用,专治“摘要模型表面正常、背后作妖”。白盒能顺藤摸瓜找出毒样本,黑盒还能只靠模型行为做审计,最后连被污染的摘要习惯都能拉回来,属于防御论文里少见的“检测+修复”双保险。
这篇论文把“RL到底把工具调用能力藏在哪儿”这件事,直接追到跨编码器里的单个特征上了。更有意思的是,它不仅能定位,还能在推理时把能力拧出来,甚至让基础模型也跟着“蹭到一点”。
这篇论文最有意思的地方,不是“又训练了一个SAE”,而是把Qwen3的内部表示拆成了能看、能评、还能直接干预的特征字典。更妙的是,它不只讲“重构得像不像”,还真的拿拒答行为做了因果干预,实用味很足。
罕见病最怕的不是治不了,而是来得太晚。RaDaR把自由文本、合成数据和推理增强揉成一套开源方案,还做了随机医生辅助试验,终于不是“纸上谈兵”的医疗大模型了。
这篇论文把机器人“换视角就失忆”的老毛病,改写成一个系统辨识问题:先随机探一探,再把这段互动当上下文喂给模型。简单粗暴,但很对路,仿真和实机都给出了不错的增益。
很多模型训练时只学顺序推理,一到测试却靠人工搭脚手架(并行采样+投票)来提分,中间有个巨大的“训练-测试”鸿沟。斯坦福这篇Spiral颠覆性地用集合强化学习,让模型边训练边学会如何搜索和如何聚合,把整个推理过程端到端打通了。效果非常硬核,4B模型推理效率吊打传统方法11倍,不愧是Chelsea Finn和Noah Goodman团队的新作!
生成AI经常“画不对题”?这可能是顶尖模型也无法避免的“语法错误”。浙大联合山大的GAZER,不走寻常路,它不重训模型,而是在生成过程中,让模型自己扮演“质检员”,通过多模态大模型“复盘”草稿,发现错误后“回炉重造”,简单一招就让图像和视频生成的语义对齐效果显著提升。同类工作中,GAZER切中了核心痛点,非常值得一看!
能让数字人听懂你说话的“套路”来了!InteractiveAvatar不仅能把语音转成视频,还能理解“看一下手表几点了”这种复杂意图,并做出相应动作。在长达数分钟的无限流式生成中,画面一致性还吊打一众对手,实时推理速度更是达到26.68 FPS。
LLM输出的“灵感”到底是从训练数据里“原样照搬”还是“高维加密”后释放?日本理研牵头的新研究首次给数据相似度(BM25)和数据影响力(KFAC)的排名关系画了张精准的“等高线图”。发现一个反直觉事实:影响力函数能更一致地预测相似度的结果,反过来则不行——这意味着“先BM25粗筛,再影响力精排”的混合方案,可能是大模型可解释性工具箱里的黄金搭档。
我们评估模型推理能力,还在用“答没答对”来一锤定音?北大等机构的最新研究HOLMES告诉你,答案对了,但推理过程可能全是“捷径”!这个首个面向高阶逻辑推理的真实世界基准,无情地揭露了GPT-5.4、DeepSeek、Qwen等一众顶级大模型,处理起需要“规则打架”、“跨范围组合”的现实问题时,表现有多拉胯。是时候关注推理过程的“忠信度”了。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球