← 返回 PaperDaily 大模型与智能体

不保护隐私用户就跑光?法国团队首次给出数学证明

拍文档照片最怕什么?阴影、模糊、歪斜、摩尔纹——哪怕是最强多模态模型也会当场翻车。直接拿恢复工具全图修一遍?可能越修越糟糕。华南理工这篇论文给了个聪明的解法:让模型自己判断“现在能不能答”,不能答再精准修复,修坏了还能自动回滚。全程免训练,效果逼近人类专家。

不保护隐私用户就跑光?法国团队首次给出数学证明
原论文信息如下:
论文标题:
DocIntent: Answerability-Guided Agentic Restoration for Real-World Document Visual Question Answering
发表日期: 2026年08月
发表单位: 华南理工大学(South China University of Technology)
原文链接: https://arxiv.org/pdf/2608.29037v1.pdf
龙哥推荐理由:第一,免训练、零额外模型依赖,不靠专门的退化分类器或图像质量评估模型,纯靠多模态模型自身的判断力,落地门槛低。第二,核心思路抓人——“问题答不出才修,修坏了就回滚”,避开盲目全图恢复带来的文本扭曲风险。第三,实验做得很扎实,在WildDoc基准上把Gemini-3.1-Pro的一致性分数从75.5拉到了80.0,距离人类专家预处理只差0.4个点。这活儿值得围观。

真实世界文档问答为何如此困难?

拍一张发票照片要几步?掏出手机、对准、咔嚓——但如果阴影刚好落在金额栏上呢?如果纸张皱成一团、字迹发糊呢?这时候把照片直接扔给最强多模态大模型(Multimodal Large Language Models,MLLMs),它很可能一本正经地给出一个完全错误的数字。这不是段子,而是WildDoc基准上被反复验证的事实:真实世界的模糊、阴影、几何扭曲、摩尔纹、光照不均、旋转,足以让目前最先进的MLLM在文档问答上大幅翻车。
一个很自然的想法是:直接拿现成的图像恢复工具把图修一遍,再让模型去回答。但问题恰恰出在这里。现有文档恢复工具大多优化的是SSIM、PSNR这类全局图像质量指标,而“发票金额那三个数字能不能被看清”这种局部文字可读性,根本不在它们的优化目标里。盲修一遍,轻则白费算力,重则把原本清晰的文字修出伪影,把本来能答对的问题修成答错。
更隐蔽的问题是:不同问题对退化的敏感度完全不一样。一张图上有阴影也有扭曲,但如果问题问的是“左上角标题是什么”,阴影并不影响回答,只有扭曲才挡路。把所有退化不分青红皂白全部处理一遍,反而会累积恢复操作带来的文本扭曲风险。那能不能让AI像人类专家一样,先判断“这个图现在能不能答”,再决定修哪里、怎么修、修完要不要保留?这正是华南理工大学这篇论文要解决的核心问题。
论文里有个对比很直观:同样一张被阴影遮住金额的发票,直接问答、盲目修复后问答、以及DocIntent处理后的问答,结果天差地别。盲目修复有时会把“212”修成“292”,而DocIntent则能稳住正确答案。需要特别说明的是,DocIntent整体框架不做任何训练,也不需要额外的退化分类器或图像质量评估模型,纯粹靠MLLM已有的底层能力来驱动决策。

DocIntent:让MLLM自己决定何时恢复文档

DocIntent的思路用一句话概括就是“以终为始”:一切恢复操作都围绕“能不能答出这个问题”来展开,而不是围绕“图片好不好看”来展开。框架整体由三个核心模块协同工作:可答性引导分析(Answerability-Guided Analysis)、工具执行(Tool Execution)、基于比较的回滚(Comparison-Based Rollback)。
图2:DocIntent框架总览,展示两阶段循环机制:阶段A(可答性引导恢复)和阶段B(基于比较的审查)。图中示例展示了去阴影触发回滚(左下),而外观增强成功并继续(右下)。
先看可答性引导分析。MLLM拿到图像和问题后,第一件事不是修复,而是判断“当前图像信息到底够不够回答问题”。能答就直接出答案,不浪费任何算力;不能答,模型需要进一步指出是哪种退化在阻碍回答,并选择其中最严重、且工具列表里可用的那一种进行恢复。这个设计的精妙之处在于,它把“要不要恢复”从人的主观经验判断,变成了模型基于任务目标的自主推理。
再看工具执行模块。论文维护了一个可用的恢复工具列表,初始包含八种操作:去模糊(deblurring)、去扭曲(dewarping)、去阴影(deshadowing)、外观增强(appearance enhancement)、去摩尔纹(demoiréing)、90°旋转、180°旋转、270°旋转。这些工具分别针对模糊、扭曲、阴影、光照不均、摩尔纹和方向错误等常见退化。更关键的是,论文设计了一套标准化的工具接口,未来可以无缝接入更强的恢复模型,也可以为新型退化扩展新工具。
最后是基于比较的回滚。现有的智能体恢复框架往往依赖微调的退化感知模型或专门的图像质量评估模型来打分,DocIntent则完全绕开了这条路。它直接把“当前问题 + 修复前的图 + 修复后的图”一起丢给MLLM,让模型自己比较问题相关证据的可读性。如果修复后的文字更清晰、更容易回答,就保留;如果修坏了、反而更难读,就触发回滚,并把该工具从可用列表里禁用,转而尝试处理其他退化。这样既不需要额外训练,又天然形成了一个质量安全阀。
图4:代表性案例展示,即使图像存在可见退化,部分问题依然可以被正确回答。D表示退化类型。
为什么“选择性恢复”这么重要?图4给出了答案。上面这些图像都有明显的退化痕迹,但相关问题完全可以直接回答。如果按照传统“全图修复”的思路,这些退化会被强行处理一遍,反而可能引入新的文字扭曲或模糊。DocIntent的判断逻辑是:退化存在但没挡路,就不动它。这种克制,恰恰是它与“看到退化就修复”的传统方案最本质的区别。

两阶段循环机制:从判断到验证的闭环

把三个模块串起来,就构成了DocIntent的两阶段循环机制。
阶段A:可答性引导恢复(Answerability-Guided Restoration,AGRes)。MLLM先判断当前图像是否足以回答问题。如果足以,直接生成答案;如果不足,就需要识别出最阻碍可答性的退化类型,并调用对应工具进行恢复,然后进入阶段B。
阶段B:基于比较的审查(Comparison-Based Review)。系统把“当前问题、修复前的图像、修复后的图像”一起交给MLLM,让模型判断这次恢复到底有没有让问题相关的证据变得更清晰。如果确实改善了,就接受修复结果;如果“越修越糟”,就触发基于比较的回滚(Comparison-Based Rollback,CBRb),恢复原图并禁用该工具。然后回到阶段A,继续判断是否已经能回答。
循环会一直持续,直到满足两个条件之一:MLLM认为当前图像已经足够回答问题,或者所有与阻碍可答性相关的工具都已被禁用。整个过程可以写成一份非常简洁的中文伪代码:
    输入:退化文档图像 I,问题 Q,可用工具列表 T
    循环:
    1. 阶段A:让MLLM判断 (I, Q) 是否可答
       - 若可答:直接输出答案,结束
       - 若不可答:选出最影响可答性的退化类型 d,且 d 对应工具在 T 中
    2. 若没有可用工具:基于当前 I 直接回答,结束
    3. 调用工具对 I 进行恢复,得到 I'
    4. 阶段B:将 (I, Q, I') 交给 MLLM,比较问题相关证据的可读性
       - 若 I' 更清晰:I ← I',保留该工具
       - 若 I' 更糟:I 保持不变,从 T 中禁用该工具
    回到循环开始
    图6:回滚机制演示。失败的恢复触发回滚并尝试替代方案。
    图6展示了回滚机制的一个典型案例。某次去阴影操作把原本尚可辨认的数字修得更模糊,DocIntent的CBRb模块敏锐地发现恢复后文本可读性反而下降,于是果断回滚,并换用其他策略继续尝试。这个“试错-验证-回滚”的闭环,保证了即便MLLM的一次决策失误,也不会污染后续的推理过程。
    这套设计天然具备两个理想性质。一是最小性:只处理真正阻碍可答性的退化,避免多余计算;二是安全性:每一次恢复动作在提交前都要经过验证,防止错误在连续操作中逐步累积。这两个性质,构成了DocIntent在真实退化场景下稳定发挥的基础。

    实验结果:一致提升,接近人类专家水平

    实验在WildDoc基准上进行,这是目前少有的专门面向真实拍摄退化场景的文档视觉问答(Document Visual Question Answering)基准,包含三个子任务:WildDocVQA(自然文档问答)、WildChartQA(图表问答)、WildTableVQA(表格问答),覆盖模糊、阴影、几何失真、摩尔纹、光照不均和旋转六类退化。每个问题对应四种真实拍摄条件下的图像,因此除了常规准确率,还能评估模型跨退化场景的一致性(Consistency)。
    指标方面,WildDocVQA采用ANLS(Average Normalized Levenshtein Similarity,平均归一化莱文斯坦相似度),用于衡量预测答案与参考答案之间的字符级相似度;WildChartQA和WildTableVQA采用Accuracy(准确率)。其中ANLS的公式如下:
    ANLS计算方式为:对所有问题取平均,每个问题取其预测答案与N个参考答案之间归一化相似度的最大值。
    简单理解,ANLS先对某一问题的预测答案与多个参考答案逐一计算归一化莱文斯坦相似度,取其中的最大值作为该问题的相似度,再对所有问题求平均。1.0表示所有预测都完全匹配至少一个参考答案,0表示完全没有重叠。相比“全对或全错”的硬匹配,ANLS能更细腻地反映部分匹配的文本质量。
    作者选择Qwen3.5-9B(开源)和Gemini-3.1-Pro(闭源)作为主实验的backbone模型。恢复工具方面,用DocRes来处理去模糊、去扭曲、去阴影和外观增强,用UniDemoiré来处理去摩尔纹。所有恢复工具部署在单张NVIDIA A6000 GPU上,开源MLLM运行在4张A6000上,闭源MLLM通过官方API访问。
    表1:WildDoc基准上的评测结果。
    表1的结果有两个看点。第一个看点是:几乎所有基线模型都存在明显的“分数-一致性鸿沟”。比如Claude Sonnet 4.6平均分57.5%,但一致性只有30.5%,差了27个百分点;即便强如Gemini-3.1-Pro,平均分83.0%和一致性75.5%之间也差了7.5个百分点。这说明模型在不同退化条件下“忽好忽坏”是普遍现象,而这恰恰是真实场景里最致命的。第二个看点是DocIntent带来的提升。Gemini-3.1-Pro加持DocIntent后,平均分从83.0%升到84.3%,一致性从75.5%升到80.0%,涨了4.5个点;Qwen3.5-9B加持后,平均分从68.5%升到71.6%,一致性从49.7%升到55.6%,涨了5.9个点。一致性提升幅度明显大于平均分提升,说明DocIntent不仅让模型答得更准,更让模型在不同真实退化条件下答得更稳定。
    v2-74ba8bc1c6c52a48ea1c3c5c67685ca3_hd.jpg
    图3展示了两个直观案例:左侧两列是Qwen3.5-9B,右侧两列是Gemini-3.1-Pro。未经处理的退化图像让模型给出错误答案,而经过DocIntent选择性恢复后,同一模型能正确读出被阴影或模糊遮挡的关键信息。
    图3:模型在退化图像上失败、但在DocIntent辅助下成功的案例。左两列:Qwen3.5-9B;右两列:Gemini-3.1-Pro。
    除了“修不修”的决策,论文还专门对比了不同的恢复策略。除了不做恢复的No restoration之外,还有三种参考策略:Pipeline(不管图像有没有退化,把所有工具按顺序盲目跑一遍)、MLLM-Judge(先让MLLM识别图像中的退化类型,再调用对应工具)、Human Expert(由40位有文档恢复经验的专业人员人工选择工具)。其中Human Expert还分两个版本:不知道问题版本的Human Expert,以及知道问题后精准定位关键证据的Human Expert(Question-aware)。值得注意的是,所有这些对比策略都没有回滚机制。
    表2:WildDoc基准上不同恢复策略的对比。
    表2展示的结果很有意思。Pipeline把五个工具全部跑一遍,反而把Qwen3.5-9B的平均分从68.5%拉到63.2%,属于典型的“好心办坏事”。MLLM-Judge虽然把工具调用次数降到平均2.78次,但性能忽上忽下,说明光会识别退化还不够,还得知道这个退化到底有没有影响本次回答。最亮眼的是工具调用次数:DocIntent在Qwen3.5-9B上平均只调1.69次工具,在Gemini-3.1-Pro上更是只调1.16次,比“问题感知的人类专家”的1.55次还少,而平均分和一致性都逼近甚至超过人类专家。这直接说明了一个结论:文档恢复对VQA的价值,关键不在恢复工具本身有多强,而在编排策略有多聪明
    为了验证每个模块的贡献,论文还做了消融实验,结果见表3。实验对比了四种配置:完全不带DocIntent的原始模型、只用可答性引导提示词(AG Prompt)、加可答性引导恢复(AGRes)、再加比较回滚(CBRb)的完整版。
    表3:WildDoc基准上DocIntent各组件的消融实验。
    一个容易被忽略的细节是:仅仅给模型加一段“请你仔细看能不能回答”的提示词(Prompt-only),对Qwen3.5-9B反而略微降分(从68.5%降到67.8%)。这说明DocIntent的增益不是靠“把指令说得更好听”得来的,而是靠真实地改变图像输入。拆分来看,AGRes对Gemini-3.1-Pro的贡献更明显,平均分从83.0%提升到83.7%,一致性从75.5%提升到78.4%;而CBRb对Qwen3.5-9B的兜底作用更关键——弱模型本身判断力有限,AGRes带来的提升有限,但CBRb能及时拦截错误恢复操作,最终把一致性拉到55.6%。这个“强模型靠决策、弱模型靠纠错”的分工,恰恰说明整个框架设计的互补性。
    表4:额外多模态大模型在WildDoc基准上使用与不使用DocIntent的性能对比。
    论文还在更多MLLM上验证了方法的泛化能力。表4显示,DocIntent对InternVL3.5-8B、Qwen3.6-27B等模型也都带来了一致提升,说明这套选择性恢复框架并不依赖某一家模型的特殊能力。表5则对比了上下文管理策略,发现“保留文本判断历史 + 上一张图像”的轻量记忆足以支撑多轮决策,不需要把所有历史图像全堆进上下文。
    表14:不同模型和任务下,使用DocIntent前后每个样本的平均token消耗对比。
    从工程落地角度看,读者一定关心多出来的代价。论文在表14中给出了详细的token消耗数据:DocIntent会额外占用一定量的输入输出token,但换来的是问答准确率和一致性的大幅提升。对调用API的闭源模型用户来说,这部分token会直接转化为成本,需要在性能提升和预算之间做权衡。

    局限与展望:智能体恢复的边界在哪里?

    DocIntent的局限也很清晰。首先,系统的性能上限受制于底层恢复工具本身——如果去模糊工具面对严重运动模糊时本身就无能为力,那么再聪明的编排策略也无力回天。其次,作为免训练框架,所有判断都依赖基础MLLM的固有推理能力,这意味着弱模型可能在某些复杂场景下做出不理想的可答性判断。最后,多轮循环会带来额外的推理延迟和token开销,对实时性要求极高的场景需要谨慎评估。
    但换个角度想,DocIntent真正的贡献其实不在于某一个模块有多强,而在于它重新定义了“文档恢复”这件事的思考方式:恢复不是独立于下游任务的图像美化步骤,而应该作为问答链路中的一环,围绕任务目标动态决策。标准化的工具接口意味着,未来一旦有更强、更快的恢复模型出现,DocIntent可以无缝接入并立刻受益。论文还提到,这套框架目前专注于图像层面的恢复,未来如果将OCR置信度反馈、版面结构分析也纳入决策信号,可答性判断还能做得更精细。
    龙哥认为,DocIntent最值得关注的示范意义在于:它证明了“编排策略”有时比“单个模型能力”更能决定一个系统的实用性下限。在真实业务场景中,这样的思路也可以被迁移到更多“先处理、再理解”的pipeline里,比如表格识别前的前处理、票据OCR前的图像清洗、甚至医疗影像问答中的感兴趣区域增强。这或许才是这篇论文最有价值的溢出效应。

    龙迷三问

    下面是龙哥对于大家可能的一些问题的解答:
    这篇论文到底在解决什么问题?多模态大模型在模糊、阴影、摩尔纹等真实退化文档上问答能力骤减,华南理工提出DocIntent免训练框架:先判断可否作答,再按需调用恢复工具,修复无效自动回滚。
    这篇工作最值得看的点是什么?DocIntent在WildDoc基准上一致提升了不同能力水平的开源和闭源MLLM的平均分数和一致性。在Gemini-3.1-Pro上平均分数从83.0%提升至84.3%,一致性从75.5%提升至80.0%;在Qwen3.5-9B上平均分数从68.5%提升至71.6%,一致性从49.7%提升至55.6%。在8个不同MLLM上的扩展实验均显示一致改进。
    这篇工作的边界或风险在哪里?优点:(1) 无需额外训练,直接利用MLLM的固有判断能力,即插即用;(2) 通过可回答性引导实现选择性恢复,避免不必要的处理开销和潜在风险;(3) 基于比较的回滚机制提供质量保障,防止错误累积;(4) 标准化工具接口支持未来扩展。缺点:(1) 系统性能受限于底层恢复工具的能力上限;(2) 判断能力依赖底层MLLM的固有智能水平,较弱模型上效果提升有限;(3) 增加了推理时的token消耗和计算开销。
    如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

    龙哥点评

    论文创新性分数:★★★★☆

    提出DocIntent框架,通过两阶段循环机制(可回答性引导恢复与基于比较的回滚),让MLLM自主判断是否需要恢复、选择工具并验证恢复效果,实现无需训练的、面向下游文档VQA任务的智能体选择性恢复。

    实验合理度:★★★★☆

    ANLS(平均归一化Levenshtein相似度)、准确率(Acc.)、一致性(Consistency)

    学术研究价值:★★★★☆

    提出DocIntent框架,通过两阶段循环机制(可回答性引导恢复与基于比较的回滚),让MLLM自主判断是否需要恢复、选择工具并验证恢复效果,实现无需训练的、面向下游文档VQA任务的智能体选择性恢复;更关键的是问题定义是否可复用到同类任务。

    稳定性:★★★☆☆

    现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

    适应性以及泛化能力:★★★☆☆

    现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

    硬件需求及成本:★★★☆☆

    对于Qwen3.5-9B,平均每样本消耗19032个token;对于Gemini-3.1-Pro,平均每样本消耗6106个token;所有恢复工具部署在单张NVIDIA A6000 GPU上

    复现难度:★★★☆☆

    现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

    产品化成熟度:★★★☆☆

    论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

    可能的问题:;(3) 基于比较的回滚机制提供质量保障,防止错误累积;(4) 标准化工具接口支持未来扩展。缺点:(1) 系统性能受限于底层恢复工具的能力上限;(2) 判断能力依赖底层MLLM的固有智能水平,较弱模型上效果提升有限;

    主要参考文献

    [1] Zihan Huang, Shihang Wu, Junle Liu, Peirong Zhang, Yongxin Shi, Xuhan Zheng, Lianwen Jin. DocIntent: Answerability-Guided Agentic Restoration for Real-World Document Visual Question Answering. arXiv:2608.29037, 2026.
    [2] Wang et al. WildDoc: Document VQA Benchmark under Real-World Capture Degradations, 2025. (详见原论文引用)
    [3] Zhang et al. DocRes: A Generalist Model for Document Image Restoration, 2024.
    [4] Yang et al. UniDemoiré: Towards Unified Image Demoiréing, 2025.
    [5] Chen et al. RestoreAgent: Autonomous Image Restoration Agent via Multimodal Large Language Models. NeurIPS, 2024.
    [6] Zhu et al. AgenticIR: Agentic Image Restoration Based on LLM. 2024.

    end
    拍文档、发票、表格总被阴影和模糊虐待?大模型也头疼!看懂DocIntent的“按需修复+自动回滚”,从此告别盲目修图翻车现场。想和龙哥一起轻松读论文、聊落地?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
    『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
    wechat_helper dianzan

    *本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

    转发文章 微博 X LinkedIn Facebook
    龙哥读论文 · PaperDaily

    本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。