← 返回 PaperDaily
大模型与智能体
VLDB 2026新作Auto-Fill:1%成本补齐表格空缺
表格缺失值预测看似是“补空”,本质却是“别乱猜”。这篇论文最有意思的地方,不是把模型堆大,而是把任务拆成三种能力,再用校准和弃权把自信管住。
龙哥读论文
发布于 2026-08-14 09:11:24
阅读 3
查看原文
原论文信息如下:
表格缺失值填充:大模型很强大,但为何不适合大规模部署?
表格补空这件事,看起来像“把空白填上”这么简单,实际却很容易翻车。填错一个单元格,轻则让统计结果跑偏,重则把后面的分析一起带沟里。Auto-Fill 盯住的正是这个老问题:不是能不能填,而是敢不敢填、填得准不准 。
很多人第一反应会是:直接上最强推理大模型不就行了?问题就在这儿——表格缺失值预测不是“讲道理”就完事,它要求高精度、低成本、会弃权 三件事同时成立。前沿大模型虽然会推理、会写代码、也知道不少常识,但它们普遍有两个毛病:一是贵,二是太自信。对普通聊天来说,自信一点问题不大;对表格补空来说,瞎自信就是灾难。
这篇论文的判断很直接:表格补空并不是单一能力题,而是三种能力混合题——知识 、推理 、编码 。与其让一个模型硬撑全场,不如让三位专家各干各的,再让一个“裁判”决定谁上场,谁闭嘴。这个思路听着朴素,但在工程上很实在:把能力拆开,往往比把模型堆大更靠谱 。
为了更具体地理解这个判断,我们不妨先看看表格缺失值预测的典型场景。假设你有一张包含员工信息的表格,其中“部门”列有缺失值。如果缺失的单元格属于“技术部”,而表格中其他行已经明确标注了“张三-技术部”、“李四-技术部”,那么模型只需要根据列内模式直接补上“技术部”即可——这属于知识型任务。但如果缺失的是“年度奖金”列,而该列的值需要根据“绩效评分”列和“入职年限”列通过一个公式计算得出,模型就必须先理解列间关系,再进行多步推理——这就是推理型任务。更复杂的情况是,缺失值隐藏在“备注”列的一串文本中,比如“员工编号:A001,奖金系数:1.2”,模型需要从中提取信息并执行计算——这便涉及编码型任务。这三种场景在真实表格中往往交织出现,而单一模型很难同时精通所有类型。
Auto-Fill 的核心洞察在于,它没有试图用一个“万能模型”去覆盖所有情况,而是将任务拆解为三个并行的专家模块,每个模块只专注于一种能力。这种设计不仅降低了每个模型的训练难度,还使得系统在推理时可以根据具体缺失值的类型,动态选择最合适的专家。更重要的是,当所有专家都对某个缺失值没有足够把握时,系统会主动选择弃权,而不是强行给出一个可能错误的答案。这种“有所为有所不为”的策略,正是 Auto-Fill 在精度和可靠性上超越大模型的关键。
Auto-Fill:为表格“定制”三位专家,实现高精度、低成本的缺失值预测
Auto-Fill 的核心不是发明一种“万能模型”,而是把缺失值预测拆成一套更适合落地的系统。它先把完整表格随机遮住一个单元格,自动构造训练样本;再把任务分给三位小语言模型专家;最后通过校准过的置信度决定谁来回答,或者直接弃权。这个流程的本质很像表格版“专家会诊”:谁最懂、谁最稳、谁最不容易胡说八道,谁上 。
这里的“专家”不是营销话术,而是训练目标真的不同。知识专家负责直接补事实;推理专家负责处理多步逻辑;编码专家负责把表格里的隐含关系写成可执行代码。论文的设计空间探索很明确:单个混合模型虽然看上去更优雅,但在小模型上容易互相干扰;多个专家虽然看上去更“碎”,却更容易学扎实。对工程系统来说,这种“碎”反而是优点,因为它让不同能力可以独立优化、独立校准、独立替换。
论文还把任务定义得很严格:预测结果要么完全正确 ,要么就干脆弃权。这里没有“差不多”“大概像”“数值接近也行”这种糊弄空间。原因很现实:在电子表格、业务报表、分析管道里,填错一个值可能比不填更糟。这个设定也解释了为什么 Auto-Fill 不是追求“覆盖率最大”,而是追求在高精度阈值下,把能答对的尽量多答出来。
具体来说,Auto-Fill 的训练流程分为三个步骤。第一步,从完整的表格中随机选择一个单元格,将其值遮盖,构造一个训练样本。第二步,将这个带有缺失值的表格分别输入三个专家模型,每个专家根据自身的训练目标生成预测值。第三步,将三个专家的预测结果和对应的置信度分数输入到一个校准模块中,该模块通过等渗校准将不同专家的分数映射到统一的概率尺度上,然后选择置信度最高的专家作为最终输出;如果所有专家的置信度都低于预设阈值,则系统弃权。这个流程确保了每次预测都是经过严格筛选的,从而最大化了高精度下的召回率。
三位专家各显神通:知识、推理、编码,挑战表格难题
先说知识专家。很多表格缺失值其实不需要复杂推导,关键是模型要知道这个位置该填什么,并且还能把答案格式对齐到整张表的列风格 。比如某些列是“球队名 + 战绩”,有些列是日期格式,有些列是百分比格式。小模型最容易犯的错,不是答不出,而是答得“看起来像答案,实际上格式不对”。Auto-Fill 的知识专家就是专门治疗这种毛病的。
知识专家的训练很直接:把完整表格随机遮住一个单元格,模型直接输出原值。看起来像在“背答案”,但别小看这一步。它实际上逼模型学会两件事:一是沿着列方向读表,别把相邻列看串;二是输出格式要和列内其他值一致。对于表格任务,这种“读表姿势”比空谈知识更重要。
再看推理专家。很多表格里的缺失值并不是“记忆题”,而是“看关系题”。比如某一列的值其实藏在另一列字符串里,或者每一列都遵循一个隐含模式,只有把整张表串起来才能看懂。论文里举的例子很典型:有的答案藏在 ImageURL 这种字符串里,有的答案要根据列内“1、2、3 只出现一次”的规律来推。对这类题,直接补事实不管用,必须先推一遍。
推理专家的训练方式更“讲究”。论文没有直接拿一个答案就硬训,而是让教师模型先生成多条推理轨迹,再筛掉错的,只保留对的,而且优先选择更短、更清晰的那条。这个设计很像“把会做题的人留下,把废话多的草稿扔掉”。更关键的是,推理专家的置信度不能简单看最终答案 token 的概率,因为推理链一长,最后那一步往往被前面的上下文“托高了”,概率很虚。于是论文改用多次采样后的结果分布来估计可靠性,这才更像真的置信度。
具体来说,推理专家的训练数据是通过一个更大的教师模型(如 GPT-4)生成的。教师模型会针对每个缺失值,生成多条包含完整推理步骤的文本,例如“首先,观察第3列的值是‘A’,第5列的值是‘B’,根据规则X,可以推断出缺失值应该是‘C’”。然后,论文会通过一个验证器检查每条推理轨迹是否最终得出了正确的答案。只有那些推理步骤正确且答案正确的轨迹才会被保留,并且优先选择步骤更简洁的轨迹。这种“蒸馏”方式确保了推理专家学到的不是死记硬背,而是真正的逻辑推理能力。
最后是编码专家。这个专家最像“做题时偷偷开了计算器”。当表格中的关系本质上是数值计算、比例求和、约束求解时,让模型直接用自然语言去算,容易出小数点级别的错误;而把关系转成代码,再执行一遍,通常更稳。论文里的例子就是:某个百分比由其他几个百分比相减得到,直接写代码算就比嘴算靠谱得多。
编码专家的训练也不是随便写段代码就完事。论文会先让教师模型生成候选代码,再检查代码是否真的能把目标值算对;只有通过验证的轨迹才进入训练。这个做法很朴素,但非常工程化:能跑通的代码才是好代码,能算对的轨迹才是好轨迹 。在表格领域,这种“可执行”比“会说”更有价值。
编码专家的训练数据同样来自教师模型。教师模型会针对需要计算的缺失值,生成一段 Python 代码,例如“df['new_col'] = df['col1'] - df['col2']”。然后,论文会在一个沙盒环境中执行这段代码,并检查计算结果是否与真实值一致。只有那些能正确计算出结果的代码才会被用于训练。这种“代码即答案”的方式,使得编码专家在处理数值计算、字符串拼接、日期运算等任务时,具有天然的优势,因为它避免了模型在数值精度上的天然缺陷。
不止于“组合”:通过置信度校准实现动态集成与明智弃权
如果只是把三个专家堆在一起,那还不够。真正决定系统能不能用的,是谁来拍板。Auto-Fill 最有意思的地方就在这里:它不是简单投票,也不是“谁分数高就信谁”,而是先把每个专家的置信度校准到同一把尺子上,再让最可信的那个出手;如果没有人足够靠谱,就直接弃权。
这里的关键术语要先说清楚。置信度校准 ,英文是 calibration,意思是让模型说“我有 80% 把握”时,这个 80% 尽量真的是 80%。很多语言模型最大的问题不是不会答,而是“太敢答”。在高精度任务里,这种过度自信会让系统把错误答案包装成正确建议,后果比沉默更糟。
论文里还用了 isotonic calibration ,中文通常叫等渗校准 。它的作用很简单:把不同专家原本不可直接比较的分数,映射到更接近真实概率的统一尺度上。这样做的好处不是“数学上更优雅”,而是工程上更能选对人。因为知识专家、推理专家、编码专家的原始分数来源不同,直接比大小很容易失真;校准之后,系统才有资格做动态选择。
论文还认真比较了几种集成方式:学习一个路由器、用传统机器学习做融合、或者做校准后的置信度选择。结果很清楚:路由器看起来聪明,但它判断的是“该叫谁来”,不是“谁真的答对了”;传统机器学习能补一点,但跨数据集不够稳;而校准后的置信度选择最符合这个任务的本质——谁对就谁上,没人稳就别硬装 。这个判断很像做人:不懂就别瞎拍板,系统也一样。
具体来说,等渗校准的工作原理是:首先在验证集上,将每个专家模型的原始置信度分数(例如,知识专家输出 token 的概率,推理专家多次采样的投票比例,编码专家代码执行的成功率)与真实正确率进行配对。然后,通过一个非参数化的单调递增函数,将这些原始分数映射到校准后的概率。这个函数保证:如果原始分数 A 大于原始分数 B,那么校准后的概率 A 也大于等于校准后的概率 B。经过这样的映射后,不同专家的分数就具有了可比性。例如,知识专家的 0.85 和推理专家的 0.82,现在都表示“大约有 85% 和 82% 的概率正确”,系统可以直接比较并选择最高的那个。
超过o3-pro和Gemini 3 Pro,成本不足其1%:Auto-Fill的实战表现
论文最硬的一点,在于它没有只讲“方法听起来很美”,而是拿 11 个基准、2200 张真实表格去实测,还把质量和成本一起摆上台面。结果显示,Auto-Fill 在高精度设定下不仅能压过一批前沿推理模型,还能把推理成本压到它们的不到 1% 。这不是“稍微便宜一点”,而是直接把部署门槛打下来了。
更重要的是,论文不是只报一个总分,而是分别看了高精度区间下的召回表现、不同数据集的曲线、不同模型大小的性价比,以及各种消融实验。这样的实验设计是可信的,因为它回答了三个现实问题:第一,真的准吗;第二,准的代价大不大;第三,这个结果是不是靠某个小技巧撑起来的。
从消融实验看,几个结论很扎实。第一,单一混合模型不如多专家模型,说明不同能力硬塞进同一套参数里确实会互相打架。第二,推理和编码专家如果只做普通监督微调,效果有限;用教师蒸馏会明显更稳。第三,校准比“感觉上很自信”的路由器更靠谱。换句话说,这套系统的提升不是来自某个神奇大招,而是来自一连串更符合任务本质的工程决策。
也别把这篇论文看成“只会省钱”。更准确地说,它是在高精度约束下,把模型系统做成了一个能答、敢答、会停 的组合体。能答,是因为专家分工清楚;敢答,是因为置信度经过校准;会停,是因为系统知道什么时候该弃权。这个“会停”尤其重要,很多系统死就死在不肯闭嘴,Auto-Fill 则把“闭嘴”设计成了能力的一部分。
在 11 个基准数据集中,论文特别关注了两种场景:分布内(ID)和分布外(OOD)。分布内测试集与训练集来自同一数据源,而分布外测试集则来自完全不同的领域。结果显示,Auto-Fill 在 OOD 场景下的性能下降幅度远小于其他基线模型,这表明其多专家架构和校准机制具有更好的泛化能力。例如,在“医疗记录”数据集上训练的模型,在“金融报表”数据集上测试时,Auto-Fill 的高精度召回率仅下降了 5%,而直接使用大模型的方法则下降了 20% 以上。这进一步证明了“专业化”而非“通用化”在表格任务中的优势。
总结与展望:专业化和校准弃权在表格数据领域的重要性
Auto-Fill 的价值,不在于它把表格补空这件事“神化”了,而在于它把这件事重新拉回现实:表格任务需要的是专业化系统,不是万能嘴炮 。知识、推理、编码三种能力本来就不是同一种东西,硬塞进一个模型里往往会互相拖累;拆开之后再做校准集成,反而更稳、更便宜,也更适合落地到电子表格和数据清洗场景。
这类方法未来要继续往前走,最关键的不是再把模型做大一点,而是把数据覆盖、置信度校准、异常弃权、跨域泛化 这些问题做得更扎实。尤其是在真实业务里,表格格式千奇百怪,列名不规范、单元格脏数据、混合数值与文本、跨表依赖都很常见。只要这些边界条件没处理好,再强的模型也会被现实教育。
不过,这篇工作也有边界。它依赖高质量的专家训练与校准流程,工程链路比单模型更复杂;它强调高精度,因此对召回的追求是“有条件的”;它在真实部署里还需要继续验证不同表格分布、不同语言、不同组织内部数据规范下的稳定性。换句话说,它已经证明了“这条路可走”,但还没证明“所有地方都能一路狂飙”。
从更广阔的视角看,Auto-Fill 的工作也启发了其他表格智能任务,比如表格问答、表格到文本生成等。其“多专家+校准弃权”的范式,为构建可靠、可解释的表格 AI 系统提供了一条清晰的路径。未来,我们或许可以看到更多类似的工作,将复杂的表格任务分解为更细粒度的子任务,并通过精巧的集成机制来提升整体性能。这不仅是技术上的进步,更是对“如何让 AI 在关键业务场景中真正可信”这一命题的深刻回应。
龙迷三问
这篇论文到底解决什么问题? 它解决的是表格缺失值预测中的“高精度、低成本、会弃权”问题。不是追求把所有空都填满,而是在能保证正确的前提下尽量多填,并且在不确定时主动停手。
知识、推理、编码三种模式分别是什么意思? 知识是直接依赖模型记忆和表格格式补值;推理是通过多步逻辑从表格上下文推出答案;编码是把表格里的隐含关系写成代码并执行,适合数值计算和严格约束。
为什么一定要做置信度校准? 因为模型天生容易“过度自信”。如果不同专家的分数不能放在同一尺度上比较,系统就会选错人;校准之后,才能更可靠地决定谁回答、谁弃权。
如果还有哪些术语、细节或者实验设计想继续拆,欢迎留言继续聊。
龙哥点评
论文创新性分数: ★★★★☆。创新不在于“发明了新模型骨架”,而在于把表格补空拆成三种能力并做高精度弃权,这个问题定义挺实在。
实验合理度: ★★★★☆。11 个基准、2200 张真实表格、质量和成本一起评估,外加一整套消融,实验链条比较完整。
学术研究价值: ★★★★☆。它把“多专家 + 校准弃权”这条路线在表格任务上讲清楚了,对后续数据清洗和表格智能代理都有启发。
稳定性: ★★★☆☆。高精度场景下思路稳,但系统依赖专家训练和校准,离“随便接个表就能跑”还有距离。
适应性以及泛化能力: ★★★☆☆。在多基准上表现不错,但真实业务表格分布更杂,仍需要额外验证。
硬件需求及成本: ★★★★☆。推理成本压得很低,这点很加分;不过多专家体系本身比单模型更复杂。
复现难度: ★★★☆☆。代码开源是好事,但多专家训练、蒸馏、校准、评估链路都不算轻松。
产品化成熟度: ★★★☆☆。适合做高精度表格建议系统或数据清洗辅助模块,但还不适合无脑全自动覆盖。
可能的问题: 系统思路漂亮,但链路偏复杂;高精度优先意味着召回与覆盖率仍受约束,真实落地要看表格分布和校准质量。
主要参考文献
Yurong Liu, Yeye He, Haoyu Dong, Junjie Xing, Shi Han, Dongmei Zhang, Surajit Chaudhuri. Auto-Fill: Learning to Predict Missing Values Accurately with Specialist Language Models. arXiv:2607.19847v1, 2026.
项目开源地址:https://github.com/lyrain2001/auto-fill
论文原文:https://arxiv.org/pdf/2607.19847v1.pdf
表格缺值这事,最怕的不是不会填,而是自信满满地瞎填 。Auto-Fill 走的是另一条路:三位专家各管一摊,靠谱才出手,不靠谱就弃权。想继续看这种“既能打、又不乱答”的论文,欢迎扫码加入龙哥读论文粉丝群,一起把模型的嘴和脑子都管住~
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
表格、RAG、推理模型、数据清洗这些方向的同学尤其适合来聊 ,群里经常有能落地的硬活儿。