把CT、胃镜、化验单喂给AI后,胃癌诊断AUC涨了6个点
胃镜、CT、化验单、报告,医生从来不是单看一样就下结论。Gastric-X把这个真实逻辑搬进了AI基准:四期CT+内镜+生化指标+报告全部对齐,还配了2.6万条VQA。想让医疗VLM真正学会"综合判断",这份基准值得一读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
胃镜、CT、化验单、报告,医生从来不是单看一样就下结论。Gastric-X把这个真实逻辑搬进了AI基准:四期CT+内镜+生化指标+报告全部对齐,还配了2.6万条VQA。想让医疗VLM真正学会"综合判断",这份基准值得一读。
做AI的都知道,图像分类这活儿,看着简单,做起来全是坑。尤其是当你把模型从实验室搬到现实世界,面对的不是单一数据集的“温室环境”,而是医疗影像、卫星图、人脸表情、日常物体照片混在一起的“修罗场”。
老司机最怕的不是路况差,而是同一个坑栽两次。这篇论文给自动驾驶大模型装上一个"失败记忆库",用结构化解耦检索加上解耦LoRA测试时训练,让模型现学现卖、遇险纠偏,还把NAVSIM双榜SOTA收入囊中,代码已开源。
看长视频最怕"看多少、看哪里"的选择困难。商汤这篇EVA直接用强化学习把"先规划再看片"的训练出来,多个长视频基准提升6-12%,视觉token还省得惊人。让AI学会"聪明地看",这个方向值得重点关注。
本论文针对视觉Transformer在分布偏移下依赖背景等虚假相关性的顽疾,提出概念引导微调(CFT)。仅用1500张图、无需人工标注,让模型注意力从背景转向鸟喙、鱼鳍这类判别性语义概念,五个OOD基准一致提升。CVPR 2026 Highlight,代码已开源,可复现性强,值得细读。
机器人部署最怕什么?模型离线训得好,一到现场就“水土不服”。理想汽车联合多所高校提出VANE框架,把测试时训练做成“提案—验证—提交”的可靠流程:用未来视觉表征预测当监督信号,只在关键时刻更新,错了还能回滚。SimplerEnv上WidowX平均成功率提升3.2个百分点,反向传播计算量削减98.7%。把“边干边学”从口号变成了可信工程。
视频大模型对着画面侃侃而谈,却常常“睁眼说瞎话”?中科院团队提出VADER,一个纯推理期干预的训练无关框架,让LLaVA-Video-7B在EventHallusion上飙到72.60%,还顺手超越了依赖额外训练的TPO与RRPO。不微调也能这么能打,值得一读。
让大模型当"色偏裁判"?新国立这篇CVPR 2026论文把跨相机白平衡玩出了新花样:不直接回归光照,而是先白平衡、让视觉语言模型判断残留色偏、再迭代修正。四大基准全面碾压现有方法,最差场景误差几乎减半,思路清奇还实用。
化疗靶区勾画要改一处轮廓,AI直接"听懂"人话动手改——这是三维医学影像分割基础模型VoxTell与文本指令结合的一次亮眼尝试。冻结全部预训练权重,只训练一个轻量指令分支,就能让模型按临床语言精确编辑亚区轮廓,正确指令在跨数据集测试中比矛盾指令高出0.047的Dice分离度,方向对了。
零样本图像描述三年没挪窝,这篇论文用多检查点对齐评分框架,推理阶段把CIDEr从108.0干到117.6。不重训描述器、不吃配对数据,全靠把评分器插在更多位置上——早该这么干了!
苹果出品,必属精品?这篇论文直接把多模态对齐的“水分”挤干了——不靠GPT-4V、不靠人工标注,用一招“蒙住眼睛”的BDHS方法就能生成高质量偏好数据,效果还能打。对于想低成本做多模态对齐的人来说,这绝对是值得读的“省钱秘籍”。
扩散视觉语言模型快不起来,根子在于每一步去噪都在反复“看重”同一批视觉token。中科大这个DAVET直接把“视觉证据何时给、给多少”当作资源分配问题来做,不训练不微调,平均提速1.55倍、质量仅掉1.86%,思路相当实用。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球