安徽大学SCDT:统一去噪框架,专治RGB-T跟踪模态缺失
医生看病是逐步问诊、看检查单、更新诊断假设的过程,但现有的AI评估全是单轮问答,完全不接地气。这篇论文搞了一个1089例真实病例的多轮诊断基准,把15个模型按真实临床流程从头考到尾。结果发现推理模式反而帮倒忙,医疗微调在小模型上有用、大模型反而没优势。想了解AI在临床诊断中到底几斤几两?这篇必须读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
医生看病是逐步问诊、看检查单、更新诊断假设的过程,但现有的AI评估全是单轮问答,完全不接地气。这篇论文搞了一个1089例真实病例的多轮诊断基准,把15个模型按真实临床流程从头考到尾。结果发现推理模式反而帮倒忙,医疗微调在小模型上有用、大模型反而没优势。想了解AI在临床诊断中到底几斤几两?这篇必须读。
当“肺不张”被误判为“正常”,多亏了SCALPEL的否定感知机制,把医疗跨模态对齐从“字面匹配”拉回“临床逻辑”,背后是PMC-LLaMA+ANAO的双重保障,实测召回率涨2%,值得临床AI从业者关注。
还在为医疗分割数据的像素级标注头疼?西北大学这篇工作告诉你,医生看片子时的眼动轨迹就能当弱监督信号,而且效果居然超越了最专业的涂鸦、边界框等“传统”弱监督!更关键的是,它首次用Mamba这种高效架构建模了轨迹的时序信息,而不是把它当作一堆散点的静态图。看完你会感叹:原来最宝贵的监督信号,就藏在医生最自然的阅片习惯里。
当机器人VLA模型在域外任务中频频翻车,RL²给出了一个既聪明又高效的解法:只在预测到即将失败时,才调用离线强化学习产生的多样化动作来“组合引导”,否则就安心跟着原始VLA走。这项研究不仅揭示了“成功/失败状态缩放定律冰火两重天”的反直觉结论,还在真实机器人上带来了接近30%的成功率提升——关键是,所有模块都是轻量+离线,部署成本极低。值得所有做机器人泛化操
继2026年6月龙哥聊过AI检测器泛化难题后,哈尔滨工业大学团队在IJCAI-ECAI 2026挑战赛中给出了一个反直觉的答案:原来音视频之间的一致性假设在通用场景下根本不靠谱,解耦才是王道!DAV-Det以0.8460分夺得第一,简单粗暴但效果惊人。
这篇论文巧妙解决了多模态推荐中一个两难问题:既要利用用户行为信号优化描述,又要保持推理时纯内容生成。快手和南开提出的RecoReward用推荐器作为训练时的“裁判”,让MLLM学会生成对推荐更友好的描述,离线全面领先,在线也有实实在在的提升。思路新颖,工程上也很实用,值得做推荐系统的同学关注。
统一多模态模型(UMM)过去要么贵得离谱(训练成本几万美元、数据上亿),要么理解与生成总得二选一。Sony AI这篇Argus-Unified直接掏出“混合视觉令牌”方案,把预训练VLM的视觉编码器冻住,只花$2000和1500万数据就训出比7B模型还强的理解能力,生成效果也不拉胯。对搞低预算落地的团队来说,这是一份很实在的参考。
食物分割里,豆腐和芝士经常被搞混?国立成功大学这篇工作用一个巧妙的思路——让大语言模型(GPT-o4 mini)根据图像猜出食材名称,再把食材标签嵌入视觉特征或解码器查询中,实现精准分割。两个模块完全即插即用,在FoodSeg103上刷新SOTA达到55.0 mIoU,且仅增加3.8GB显存开销。不用搞什么对齐训练,拿来就能涨点,实用派狂喜!
犹豫不决本难测,传统多模态融合不灵。PRISM-AH另辟蹊径:轻量网络抽取出结构化证据(冲突时刻、主导模态、韵律特征),再用LLM套上专家知识推理,一次性提升2.24倍。思路新颖,适合搞多模态理解、情感计算的读者。
红外与可见光双摄设备如今很常见,可两个摄像头总有‘视角差’,导致图像对不齐。以往要么手动校准,要么用复杂的配准网络。而这篇BeyondFusion另辟蹊径——直接在扩散模型的潜空间里让两个模态‘自对齐’,还能同时输出红外超分辨率图和融合图,手机实拍效果惊艳。一篇方法干净、结果扎实的工作,值得细读。
把代码转成图片发给AI真的能省Token吗?这篇论文用675次真实API调用,把Anthropic、OpenAI、Gemini三家计费黑盒捅了个透。龙哥看完直呼:省钱是有套路,但踩坑也是一踩一个准,尤其Gemini的小代码场景能让你多掏6倍钱。搞编码助手的朋友,这篇不可不读。
你是否遇到过AI模型胸脯拍得震天响却答不对题?这篇论文发现,小VLM嘴上说着“我超自信”,但内部的token概率早就泄了底。想知道如何让模型在自己犯错时闭嘴?看这篇就够了!
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球