论文标题:
A Modular Agent for Reliable and Auditable Spatial Relation Verification in CT Scans
发表日期:
2026年08月
发表单位:
Ulm University, Ulm University Hospital, Technical University of Munich (TUM) and TUM University Hospital
原文链接: https://arxiv.org/pdf/2608.21140v1.pdf
空间推理:医学VLMs的致命弱点
先问大家一个问题:如果你是一个放射科医生,看到一张腹部CT片子,有人问你“肝脏在脾脏的左边还是右边?”,你会怎么回答?正常人扫一眼就知道了。但这事搁在AI身上,真就把一大票号称“聪明绝顶”的视觉语言模型(Vision-Language Model,简称VLM)给难住了——不是答错那么简单,而是接近随机猜测的水平。这不是龙哥瞎说。之前MICCAI 2025上就有一篇论文专门做了测试,把GPT-4o、Gemma 3、Pixtral、MedGemma这些代表模型拉出来,在MIRP RQ1基准上做CT空间关系问答。结果怎么着?准确率分别是50.5%、50.9%、50.7%、50.3%——兄弟们,抛硬币都有50%,这些大模型全都摔在了抛硬币的起跑线上。CT轴位切片上判断“左/右”、“上/下”的解剖位置关系,相当于医学影像理解的“1+1=2”。如果连这个都搞不定,那后面什么放射报告生成、结构化解剖描述、肿瘤与毗邻器官关系的判断,全都是在沙滩上盖高楼。更要命的是,端到端VLM不仅答不准,还讲不出个所以然来——它就是个黑盒,你问它为什么这么答,它给不出任何可验证的证据。图1:用于医学影像推理的混合任务型智能体总体框架。为确保可靠且可审计的答案,智能体将特定的视觉推理任务委托给专用组件。所以,当龙哥看到MICCAI 2026 Agentic AI for Medicine Workshop上这篇题为《A Modular Agent for Reliable and Auditable Spatial Relation Verification in CT Scans》的论文时,第一反应是:终于有人认真治这个“空间盲”了。来自乌尔姆大学、乌尔姆大学医院和慕尼黑工业大学的研究者们,直接换了一条赛道,不跟VLM的spatial reasoning短板死磕,而是绕过去,用模块化智能体的思路把准确率干到了94.1%。
[1] Wolf, D., Hillenhagen, H., Taskin, B., Bäuerle, A., Beer, M., Götz, M., Ropinski, T.: Your other left! vision-language models fail to identify relative positions in medical images. In: MICCAI 2025, pp. 691–701. Springer (2025)[2] Wang, P., Bai, S., Tan, S., et al.: Qwen2-VL: Enhancing vision-language model's perception of the world at any resolution. arXiv preprint arXiv:2409.12191 (2024)[3] Sellergren, A., Kazemzadeh, S., Jaroensri, T., et al.: MedGemma technical report. arXiv preprint arXiv:2507.05201 (2025)[4] Ji, Y., Bai, H., Ge, C., et al.: AMOS: A large-scale abdominal multi-organ benchmark for versatile medical image segmentation. NeurIPS 35, 36722–36732 (2022)[5] 论文原文:https://arxiv.org/pdf/2608.21140v1.pdf[6] 开源代码:https://github.com/DeveloperNomis/MICCAI-Medical-Agent