CORTEX来了:3D胸部CT推理首次变成可验证结构
这篇工作最有意思的地方,不是又做了一个医疗问答集,而是把“医生怎么想”这件事拆成了能检查、能打分、能复核的结构。对3D胸部CT来说,这比只看最终答案靠谱多了。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇工作最有意思的地方,不是又做了一个医疗问答集,而是把“医生怎么想”这件事拆成了能检查、能打分、能复核的结构。对3D胸部CT来说,这比只看最终答案靠谱多了。
这篇论文把机器人“换视角就失忆”的老毛病,改写成一个系统辨识问题:先随机探一探,再把这段互动当上下文喂给模型。简单粗暴,但很对路,仿真和实机都给出了不错的增益。
大多数自动驾驶模型都是“一条路走到黑”,直接生成轨迹,却不知道这轨迹未来会导出什么结果。中山大学等机构提出的IRR-Drive模型,让智能体先“预设意图”,再通过预测未来BEV可视化地“反思”一遍,最后才修正轨迹。这种做法在NAVSIM v1/v2两个权威榜单上都拿到SOTA,而且仅用4B参数就能干翻不少8B模型,性价比拉满。
大模型能说会道,但遇到要细看图表、小字的地方,经常"看走眼"还"自信满满"。孙海伦团队从"答案熵"入手,发现模型在不确定时会表现出更高熵值,但盲目降熵反而让模型走上捷径。SPOT-E巧妙设计了一个视觉"聚光灯",配合强化学习,只调光照不调模型,让GPT-4o和开源模型在多个密集证据任务上获得稳定提升,思路清奇又实用。
长视频问答(LVQA)一直是个“烧钱”的活,把一小时的视频全喂给大视觉模型,光是token就能上百万。而TIMEPROVE给出的策略很聪明:先派轻量级的动作检测器去“探路”,生成几个高概率的答案假设,最后才让大模型去“拍板”验证。结果呢?效果涨了7.3%,成本却降了93%。这种“先猜后验”的思路,值得每个做视频理解的人关注。
长视频问答一直是个“贵”且“难”的活儿——处理一小时视频,光视觉token就超200万。北卡大学夏洛特分校的TIMEPROVE,提供了极其优雅的解决思路:先用轻量级的动作检测模块“侦察”出关键证据片段,再只把这些精挑细选的短片段送给VLM做“终审”。结果准确率涨了7.3%,VLM调用次数锐减75%,推理成本暴跌93%!这简直就是给LVQA这个“烧钱”领域的一
给大模型加个“外挂经验库”,不用微调就能让机器人自己看懂各种故障。Fail-RAG 思路巧妙,效果扎实。无论是识别“夹爪歪了”还是“轮子卡了”,准确率都实打实提升了。想知道怎么做到的?看下去就对了。
多模态大模型推理时总“走神”答非所问,主要原因是文本指令和图像位置对不上号。这篇腾讯等联合完成的工作Timage,用了个极聪明的解法——直接把问题当作文字水印“写”在图片的恰当位置,让模型一眼就能看到该看的地方。效果惊人,7B小模型在VMCBench上干翻了GPT-4o,还不需要任何微调!
继2026年6月推过AVDM2、DenseDPO等视频生成加速和对齐方法后,今天这篇城大新作PRISM,直接把视频生成模型本身变成了最懂行且最快速的“评委”。以往用大视觉语言模型当裁判,又慢又贵,还得等视频全生成完。PRISM反其道而行之,冻结生成模型,在满是噪声的潜伏空间里就能精准打分,还能在生成早期就淘汰烂片,推理提速7.6倍。这波操作,值得所有做视频生
你遇到过吗?让VLM读个图表或者扫描PDF,模型说得头头是道:“我要先看y坐标然后对比...”结果最后答案错得一塌糊涂! 这不是推理能力不行,是 证据没入眼 。今天聊的NUS新研究SPOT-E,用一招「熵塑形」给VLM搭了个探照灯,冻结主干模型不用训,直接让GPT-4o、Gemini看图能力上一个台阶~
模型再强,看图说话也常常只说“表面现象”。今天介绍的CIAN框架,给AI装上了“新闻检索”和“故事叙述”能力,让它能闭着眼睛(不是)看清照片里的时间、地点和人物关系。想知道怎么做到的吗?让我们一探究竟。
自动驾驶评估就像考试打分。传统规则死板,遇到避让、绕行等“合理违章”就给负分;纯VLM评估虽有上下文理解,却难胜任精细安全判断。英伟达团队这次祭出杀手锏—— DriveJudge ,让VLM当“考官”,根据场景决定哪些规则该用、哪些该放一马,既保住了规则的物理严谨,又拿捏了上下文的柔性。看完绝对拍大腿:这才是评估该有的样子!
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球