← 返回 PaperDaily
视觉与图像
GeoCodeBench来了:3D视觉代码,GPT-5也只拿36.6%
这篇论文很像给大模型出了一张“3D几何博士资格考试卷”。它不只看模型会不会写代码,更看它能不能把论文读对、把几何语义守住,结果相当不客气:最强模型也没过四成。
龙哥读论文
发布于 2026-08-14 09:10:57
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇论文很像给大模型出了一张“3D几何博士资格考试卷”。它不只看模型会不会写代码,更看它能不能把论文读对、把几何语义守住,结果相当不客气:最强模型也没过四成。
原论文信息如下:
3D视觉代码生成,博士也头疼?
大模型会写代码,已经不算新闻了;真正扎心的是,它们一碰到3D几何视觉 ,就开始频繁“脑子有点转不过来”。原因很简单:这里不是普通的业务脚本,也不是套个模板就能跑通的工程代码,而是要把论文里的几何关系、坐标变换、物理公式和算法逻辑,准确翻译成可执行程序。少一个符号,结果就可能从“很对”变成“完全离谱”。
这篇论文做的事很直接:别再只看模型会不会写“像样的代码”,而是把它扔进一套真正面向3D视觉研究的考试里,看看它能不能把论文读懂、把函数补对、把单元测试过掉。这个思路很像给大模型出了一张“博士资格题”——不是背概念,而是现场做题,错了就没分。
GeoCodeBench:一个专为3D视觉打造的“博士级”编程考题
GeoCodeBench的核心很朴素:让模型补函数,而不是写作文。 论文从近年的3D视觉顶会论文和开源仓库里,筛出真正有代表性的核心函数,把代码中间那一段挖空,要求模型根据论文内容和残缺代码补完整。最后不靠“看起来像”,而靠单元测试说话。
这里有两个缩写值得先讲清楚。LLM 是Large Language Model,中文是“大语言模型”;OCR 是Optical Character Recognition,中文是“光学字符识别”。论文用OCR把PDF里的文字、公式和图提取出来,再把论文内容结构化,方便模型读取。这个步骤看着不起眼,实际上很关键:如果连论文都读歪了,后面写出来的代码大概率也会歪。
GeoCodeBench把任务分成两大类、四个能力维度。第一类是General 3D Capability ,也就是通用3D能力,主要看几何变换和力学/光学公式是否会写;第二类是Research Capability ,也就是研究能力,重点看新算法实现和几何逻辑编排。前者像基础题,后者像附加题,而且还是“论文原题附加题”。
*表格超出部分左右可以滑动
维度
GeoCodeBench覆盖内容
应用场景 3D视觉科研代码生成、论文理解、算法实现
问题建模 给定论文内容与函数骨架,补全核心实现并通过单元测试
模型Backbone及选择原因 评测多种主流开闭源LLM,观察当前生态在3D科研编码上的真实水平
损失函数 无训练损失;采用执行通过率作为评测指标
训练数据集 不适用,属于基准测试
测试数据集 来自2025年3D视觉顶会论文及其开源仓库的100个高质量任务
训练方法 不适用,重点是构建与评测
实验效果 最强模型也只到36.6%,研究型任务明显更难
方法优势 可执行、可复现、带隐藏边界测试,避免“看起来对”
方法缺点 受限于论文和仓库质量,覆盖面仍不可能穷尽所有3D任务
从工程角度看,这种设计比“问答式评测”更狠。因为3D视觉代码不是背答案能混过去的,坐标系、投影关系、几何约束、张量维度,任何一个环节出错,测试立刻翻脸。论文还专门给每道题生成多样化边界测试,专挑退化情况、极端参数和易错输入下手,防止模型只会在舒适区表演。
顶尖AI模型集体“翻车”:最高分仅36.6%
评测结果很干脆:最强模型GPT-5也只有36.6% 。这不是“差一点就满分”,而是离“可靠写对3D科研代码”还差着一大截。第二名Claude-Sonnet-4.5是31.1%,后面一串模型分数继续往下掉,说明这个问题不是某一家模型的短板,而是当前大模型整体都还没跨过去的门槛。
更有意思的是,论文指出模型有时会出现一种叫Creative Correctness 的现象,中文可以理解成“创造性正确”。意思是模型没有照着参考实现一模一样地写,但它走了另一条数学上等价的路,结果照样通过测试。这个现象挺有意思:说明模型不是只有机械复读,也能在一定程度上找到等价解法。
不过别高兴太早。创造性正确不是“模型已经懂了”,更像是“模型偶尔找到了另一条能通关的路”。真正麻烦的是,大量题目里它连正确方向都摸不到。3D视觉里很多函数并不允许随便改写,因为几何约束、坐标系和输入输出接口都卡得很死,能换写法的空间其实没想象中大。
给模型“开卷”反而不如“开半卷”?
论文还做了一个很有意思的实验:给模型不同长度的论文上下文,看它到底吃不吃得下。结果有点反常识——不是给得越多越好。 很多模型在只提供Method部分时,反而比塞进整篇论文表现更好。
这背后其实很合理。3D视觉论文里,真正决定实现成败的往往就是Method里的几句定义、几个符号、几个坐标变换。Introduction写得再热闹,和函数怎么写关系不大;实验细节再丰富,也不一定能帮你补对那一行代码。对模型来说,长文本不是“信息越多越聪明”,而是“噪音越多越容易跑偏”。
分析师眼中的“满分”与模型的“零分”差距在哪里?
论文还给出了一类很典型的失败模式:模型看懂了题目大意,却没看懂函数里真正的几何约束。比如有些题目要求的是“互相投影”或者“特定距离定义”,模型却写成了另一个看起来差不多的版本。对外行来说,这可能只差一个名词;对3D视觉来说,这往往就是从正确到错误的分水岭。
从实验设计上看,这篇工作最有价值的地方,不只是给了一个分数,而是把“为什么错”也拆出来了。错误类型分析显示,功能性错误最多,说明模型最常见的问题不是语法,而是逻辑;类型和形状错误也很高,说明3D任务对张量尺寸和几何结构的要求,远比普通代码更苛刻。换句话说,这不是“会不会写Python”的问题,而是“有没有把3D世界装进脑子里”的问题。
如果把这篇论文放到更大的背景里看,它其实是在提醒行业一件事:大模型离“科研助手”还有很长一段路,尤其是在强几何、强约束、强可验证的领域。 能写出一段像样的代码和能稳定复现一篇3D论文,中间隔着的不是“再大一点的模型”,而是更好的科学理解、更强的程序归纳能力,以及更靠谱的长上下文筛选机制。
龙迷三问
这篇论文到底解决什么问题? 它解决的是“模型能不能把3D视觉论文里的核心函数,真正写成能跑、能测、能复现的代码”这个问题。不是只会聊天式理解,而是要落到可执行实现上。
General 3D Capability 和 Research Capability 分别是什么意思? 前者是通用3D基础能力,比如坐标变换、投影、光学/力学公式;后者是论文级实现能力,比如把新算法和几何逻辑真的写出来。前者像基础题,后者像研究题。
为什么“给更多论文上下文”不一定更好? 因为长论文里有大量与具体函数无关的叙述、实验和背景信息,模型如果抓不住Method里的关键定义,就会被噪音带偏。很多时候,精简、聚焦的上下文 比“整篇塞满”更有效。
龙哥点评
论文创新性分数: ★★★★☆。把3D视觉代码生成做成“博士级”执行基准,这个定位非常准,尤其是把研究代码和隐藏测试结合起来,思路很扎实。
实验合理度: ★★★★☆。评测对象、任务来源和单元测试设计都比较严谨,能较真实地反映模型在科研编码上的能力,但仍受限于任务覆盖范围。
学术研究价值: ★★★★★。它不只是测分,更是在定义一个新问题:大模型能否可靠地做3D科学编程,这对科研助手和自动化研究流程都很有意义。
稳定性: ★★★☆☆。作为基准很稳定,作为实际生产或自动写科研代码的方案还不行,当前模型表现离“可放心使用”差得还远。
适应性以及泛化能力: ★★★☆☆。对3D视觉相关任务很有针对性,但跨到别的科学编程领域,仍需要重新构建任务和测试。
硬件需求及成本: ★★★★☆。基准本身不重,评测成本主要在模型推理;对使用者来说门槛不高,但对大模型服务端仍有一定调用成本。
复现难度: ★★★☆☆。流程清楚,框架也算标准,但任务筛选、测试设计和人工复核都需要较强领域知识,不是随便拉个脚本就能复刻。
产品化成熟度: ★★☆☆☆。更适合做评测、诊断和研究驱动的辅助工具,还谈不上直接产品化落地。
可能的问题: 任务规模仍偏小,且高度依赖论文与仓库质量;它能很好地测出“会不会写”,但对“长期稳定科研协作能力”的覆盖还不够。
主要参考文献
Wenyi Li, Renkai Luo, Yue Yu, Huan-ang Gao, Mingju Gao, Li Yuan, Chaoyou Fu, Hao Zhao. Benchmarking PhD-Level Coding in 3D Geometric Computer Vision. arXiv:2603.30038, 2026.
GeoCodeBench项目主页:https://geocodebench.github.io/
论文原文:https://arxiv.org/pdf/2603.30038.pdf
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群