← 返回 PaperDaily 视觉与图像

GeoCodeBench来了:3D视觉代码,GPT-5也只拿36.6%

这篇论文很像给大模型出了一张“3D几何博士资格考试卷”。它不只看模型会不会写代码,更看它能不能把论文读对、把几何语义守住,结果相当不客气:最强模型也没过四成。

GeoCodeBench来了:3D视觉代码,GPT-5也只拿36.6%
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文很像给大模型出了一张“3D几何博士资格考试卷”。它不只看模型会不会写代码,更看它能不能把论文读对、把几何语义守住,结果相当不客气:最强模型也没过四成。


原论文信息如下:
论文标题:
Benchmarking PhD-Level Coding in 3D Geometric Computer Vision
发表日期:
2026年03月
发表单位:
清华大学AIR,清华大学求真书院,北京智源人工智能研究院,北京大学,南京大学,多伦多大学
原文链接:
https://arxiv.org/pdf/2603.30038.pdf
项目链接:
https://geocodebench.github.io/

3D视觉代码生成,博士也头疼?

大模型会写代码,已经不算新闻了;真正扎心的是,它们一碰到3D几何视觉,就开始频繁“脑子有点转不过来”。原因很简单:这里不是普通的业务脚本,也不是套个模板就能跑通的工程代码,而是要把论文里的几何关系、坐标变换、物理公式和算法逻辑,准确翻译成可执行程序。少一个符号,结果就可能从“很对”变成“完全离谱”。
这篇论文做的事很直接:别再只看模型会不会写“像样的代码”,而是把它扔进一套真正面向3D视觉研究的考试里,看看它能不能把论文读懂、把函数补对、把单元测试过掉。这个思路很像给大模型出了一张“博士资格题”——不是背概念,而是现场做题,错了就没分。
图1:GeoCodeBench的任务层级、代表性样例与模型整体通过率
图1:左侧给出GeoCodeBench的两级任务分类;右上展示一个代表性题目,GPT-5和Kimi-K2-Instruct虽然写出了不同但都数学上成立的实现,却都能通过测试;右下则是8个主流模型的总体通过率,最高的GPT-5也只有36.6%。

GeoCodeBench:一个专为3D视觉打造的“博士级”编程考题

GeoCodeBench的核心很朴素:让模型补函数,而不是写作文。论文从近年的3D视觉顶会论文和开源仓库里,筛出真正有代表性的核心函数,把代码中间那一段挖空,要求模型根据论文内容和残缺代码补完整。最后不靠“看起来像”,而靠单元测试说话。
图2:GeoCodeBench的构建与评测流程
图2:GeoCodeBench的构建流程分成三步——先解析论文,再从代码仓库里找核心函数,最后自动生成并人工复核单元测试。这样做的目的只有一个:把“会不会”变成“跑不跑得过”。
这里有两个缩写值得先讲清楚。LLM是Large Language Model,中文是“大语言模型”;OCR是Optical Character Recognition,中文是“光学字符识别”。论文用OCR把PDF里的文字、公式和图提取出来,再把论文内容结构化,方便模型读取。这个步骤看着不起眼,实际上很关键:如果连论文都读歪了,后面写出来的代码大概率也会歪。
GeoCodeBench把任务分成两大类、四个能力维度。第一类是General 3D Capability,也就是通用3D能力,主要看几何变换和力学/光学公式是否会写;第二类是Research Capability,也就是研究能力,重点看新算法实现和几何逻辑编排。前者像基础题,后者像附加题,而且还是“论文原题附加题”。
*表格超出部分左右可以滑动
维度 GeoCodeBench覆盖内容
应用场景3D视觉科研代码生成、论文理解、算法实现
问题建模给定论文内容与函数骨架,补全核心实现并通过单元测试
模型Backbone及选择原因评测多种主流开闭源LLM,观察当前生态在3D科研编码上的真实水平
损失函数无训练损失;采用执行通过率作为评测指标
训练数据集不适用,属于基准测试
测试数据集来自2025年3D视觉顶会论文及其开源仓库的100个高质量任务
训练方法不适用,重点是构建与评测
实验效果最强模型也只到36.6%,研究型任务明显更难
方法优势可执行、可复现、带隐藏边界测试,避免“看起来对”
方法缺点受限于论文和仓库质量,覆盖面仍不可能穷尽所有3D任务
从工程角度看,这种设计比“问答式评测”更狠。因为3D视觉代码不是背答案能混过去的,坐标系、投影关系、几何约束、张量维度,任何一个环节出错,测试立刻翻脸。论文还专门给每道题生成多样化边界测试,专挑退化情况、极端参数和易错输入下手,防止模型只会在舒适区表演。
表3:GeoCodeBench的数据来源统计
表3:数据来源统计说明这些任务并不是从“玩具题库”里拼出来的,而是来自真实的3D视觉研究方向,例如Gaussian Splatting、SLAM、重建、物理建模、NeRF和3D分割等。也就是说,题目难,不是故意刁难,而是这个领域本来就这么难。
表4:GeoCodeBench不同组件的Token统计
表4:不同组件的Token统计体现了一个现实问题——论文上下文并不短,代码骨架也不是几行字就能交代清楚。长上下文对模型来说不是礼物,很多时候更像一堆“信息噪音”。

顶尖AI模型集体“翻车”:最高分仅36.6%

评测结果很干脆:最强模型GPT-5也只有36.6%。这不是“差一点就满分”,而是离“可靠写对3D科研代码”还差着一大截。第二名Claude-Sonnet-4.5是31.1%,后面一串模型分数继续往下掉,说明这个问题不是某一家模型的短板,而是当前大模型整体都还没跨过去的门槛。
表2:代表性大模型在GeoCodeBench上的表现
表2:代表性模型在总体、通用3D能力和研究能力上的表现。可以看到,模型在几何变换上普遍比在算法实现上更稳,但一旦进入“论文级实现”,分数就明显塌下去。
更有意思的是,论文指出模型有时会出现一种叫Creative Correctness的现象,中文可以理解成“创造性正确”。意思是模型没有照着参考实现一模一样地写,但它走了另一条数学上等价的路,结果照样通过测试。这个现象挺有意思:说明模型不是只有机械复读,也能在一定程度上找到等价解法。
图5:创造性正确案例
图5:同一个极线距离问题,GPT-5直接用基础矩阵F处理像素坐标,DeepSeek-R1则先转归一化坐标,再用本质矩阵E处理。两种写法不同,但数学上等价,最后都能过测试。这说明模型有时并非“背答案”,而是在做可行的几何推理。
不过别高兴太早。创造性正确不是“模型已经懂了”,更像是“模型偶尔找到了另一条能通关的路”。真正麻烦的是,大量题目里它连正确方向都摸不到。3D视觉里很多函数并不允许随便改写,因为几何约束、坐标系和输入输出接口都卡得很死,能换写法的空间其实没想象中大。

给模型“开卷”反而不如“开半卷”?

论文还做了一个很有意思的实验:给模型不同长度的论文上下文,看它到底吃不吃得下。结果有点反常识——不是给得越多越好。很多模型在只提供Method部分时,反而比塞进整篇论文表现更好。
图8:不同论文长度下的整体表现
图8:整体结果显示,很多模型在“Method截断”条件下达到峰值,完整论文输入并没有带来稳定增益,甚至会拖后腿。对长文本理解能力一般的模型来说,过量上下文会把真正的算法线索淹没。
图7:不同论文长度下的细分维度表现
图7:细分维度进一步说明,像几何变换、力学/光学这类通用知识,受上下文长度影响不大;但新算法实现和几何逻辑编排,对上下文质量非常敏感。换句话说,模型不是缺信息,而是缺“抓重点”的本事。
这背后其实很合理。3D视觉论文里,真正决定实现成败的往往就是Method里的几句定义、几个符号、几个坐标变换。Introduction写得再热闹,和函数怎么写关系不大;实验细节再丰富,也不一定能帮你补对那一行代码。对模型来说,长文本不是“信息越多越聪明”,而是“噪音越多越容易跑偏”。

分析师眼中的“满分”与模型的“零分”差距在哪里?

图3:通用3D能力与研究能力的对比
图3:通用3D能力和研究能力之间存在明显差距,而且两者还呈正相关。意思很明确:几何基础越扎实,研究型实现通常越不差;但“基础会一点”绝不等于“论文代码就能写对”。
论文还给出了一类很典型的失败模式:模型看懂了题目大意,却没看懂函数里真正的几何约束。比如有些题目要求的是“互相投影”或者“特定距离定义”,模型却写成了另一个看起来差不多的版本。对外行来说,这可能只差一个名词;对3D视觉来说,这往往就是从正确到错误的分水岭。
图4:简单函数上的一致性失败案例
图4:一个看似很短的事件累积函数,所有测试模型都失败了。这个案例说明,难点不一定在“代码长”,而在“几何/物理含义是否真懂”。
图6:通用能力与研究能力的分化
图6:DeepSeek-R1能做对基础几何题,但在论文特定函数上翻车。这个对比很说明问题:大模型不是没学过几何,而是还没学会把论文里的流程稳定地变成程序。
从实验设计上看,这篇工作最有价值的地方,不只是给了一个分数,而是把“为什么错”也拆出来了。错误类型分析显示,功能性错误最多,说明模型最常见的问题不是语法,而是逻辑;类型和形状错误也很高,说明3D任务对张量尺寸和几何结构的要求,远比普通代码更苛刻。换句话说,这不是“会不会写Python”的问题,而是“有没有把3D世界装进脑子里”的问题。
图9:常见失败类型分布
图9:错误分布里,功能性错误占大头,类型和形状错误紧随其后。语法错和导入错反而不是最主要问题,说明模型更大的短板在“理解错”,不是“打字错”。
如果把这篇论文放到更大的背景里看,它其实是在提醒行业一件事:大模型离“科研助手”还有很长一段路,尤其是在强几何、强约束、强可验证的领域。能写出一段像样的代码和能稳定复现一篇3D论文,中间隔着的不是“再大一点的模型”,而是更好的科学理解、更强的程序归纳能力,以及更靠谱的长上下文筛选机制。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是“模型能不能把3D视觉论文里的核心函数,真正写成能跑、能测、能复现的代码”这个问题。不是只会聊天式理解,而是要落到可执行实现上。

General 3D Capability 和 Research Capability 分别是什么意思?前者是通用3D基础能力,比如坐标变换、投影、光学/力学公式;后者是论文级实现能力,比如把新算法和几何逻辑真的写出来。前者像基础题,后者像研究题。

为什么“给更多论文上下文”不一定更好?因为长论文里有大量与具体函数无关的叙述、实验和背景信息,模型如果抓不住Method里的关键定义,就会被噪音带偏。很多时候,精简、聚焦的上下文比“整篇塞满”更有效。

如果还有哪些想了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把3D视觉代码生成做成“博士级”执行基准,这个定位非常准,尤其是把研究代码和隐藏测试结合起来,思路很扎实。

实验合理度:★★★★☆。评测对象、任务来源和单元测试设计都比较严谨,能较真实地反映模型在科研编码上的能力,但仍受限于任务覆盖范围。

学术研究价值:★★★★★。它不只是测分,更是在定义一个新问题:大模型能否可靠地做3D科学编程,这对科研助手和自动化研究流程都很有意义。

稳定性:★★★☆☆。作为基准很稳定,作为实际生产或自动写科研代码的方案还不行,当前模型表现离“可放心使用”差得还远。

适应性以及泛化能力:★★★☆☆。对3D视觉相关任务很有针对性,但跨到别的科学编程领域,仍需要重新构建任务和测试。

硬件需求及成本:★★★★☆。基准本身不重,评测成本主要在模型推理;对使用者来说门槛不高,但对大模型服务端仍有一定调用成本。

复现难度:★★★☆☆。流程清楚,框架也算标准,但任务筛选、测试设计和人工复核都需要较强领域知识,不是随便拉个脚本就能复刻。

产品化成熟度:★★☆☆☆。更适合做评测、诊断和研究驱动的辅助工具,还谈不上直接产品化落地。

可能的问题:任务规模仍偏小,且高度依赖论文与仓库质量;它能很好地测出“会不会写”,但对“长期稳定科研协作能力”的覆盖还不够。


主要参考文献

Wenyi Li, Renkai Luo, Yue Yu, Huan-ang Gao, Mingju Gao, Li Yuan, Chaoyou Fu, Hao Zhao. Benchmarking PhD-Level Coding in 3D Geometric Computer Vision. arXiv:2603.30038, 2026.
GeoCodeBench项目主页:https://geocodebench.github.io/
论文原文:https://arxiv.org/pdf/2603.30038.pdf

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。