← 返回 PaperDaily 视觉与图像

NYU新作HIG:直方图精确控图还不用训练

这篇论文最有意思的地方,不是“又一个可控生成”,而是把控制粒度卡在了文本和结构之间的中间地带:既想要全局分布,又要求精确到直方图。HIG用最优传输把这件事做成了,而且还是推理时、无需训练、还能顺手做信息嵌入,思路挺干净。

NYU新作HIG:直方图精确控图还不用训练
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是“又一个可控生成”,而是把控制粒度卡在了文本和结构之间的中间地带:既想要全局分布,又要求精确到直方图。HIG用最优传输把这件事做成了,而且还是推理时、无需训练、还能顺手做信息嵌入,思路挺干净。


原论文信息如下:
论文标题:
Histogram-constrained Image Generation
发表日期:
2026年06月
发表单位:
Center for Data Science, New York University Shanghai, Shanghai, China; New York University, New York, USA
原文链接:
https://arxiv.org/pdf/2606.31683v1.pdf
项目链接:
https://maps-research.github.io/hig/
一张图想要“像谁就像谁”,这类任务现在早就不稀奇了;难的是,既要听话,又要听得精确,还不能把图像搞脏。这篇 HIG 把控制粒度卡在了一个很妙的位置:不走纯文本那种“说个大概”,也不走结构条件那种“像素级绑死”,而是直接盯住图像的直方图分布下手。说人话就是:它不只管“画什么”,还管“颜色怎么分布、潜在令牌怎么分布”。
图1:HIG整体框架示意图
图1:HIG整体框架示意图。方法在扩散采样过程中插入显式的最优传输(OT)引导,通过“解码—变换—再编码”的方式,精确把中间结果拉到目标直方图上,同时还能和文本、ControlNet、LoRA 等控制方式并存。

精准控色新范式:直方图约束的图像生成

扩散模型现在很强,但“强”不等于“听话”。文本提示词负责告诉模型大方向,ControlNet 一类方法负责把结构钉住,问题是中间这大片空间一直没人好好管:全局分布层面的控制。HIG 盯上的正是这一层。它不要求图里每个像素都严格对齐某张参考图,而是要求图像整体的颜色分布、或者潜在令牌分布,必须满足目标直方图。
这里先把“直方图”说清楚:它本质上就是一个离散概率分布。比如颜色直方图可以理解成“图里有多少比例的像素落在某个颜色桶里”;潜在直方图则是“有多少 token 落在某个离散码本项里”。HIG 的厉害之处在于,它不是粗糙地“尽量接近”,而是通过最优传输(OT,Optimal Transport,最优传输)把分布精确搬过去
图2:单选项分箱与多选项分箱示意图
图2:单选项分箱与多选项分箱示意图。单选项分箱里,每个桶只有一个候选值;多选项分箱则允许一个桶里保留多个候选值,能在满足分布约束的同时减少视觉失真。
这个思路的妙处在于,它把“控制”从语义层往下挪了一层。文本控制像是在说“给我一只猫”,结构控制像是在说“猫站在这里、朝这个方向”,而 HIG 更像是在说“整张图的颜色统计必须长这样”。这类约束比文本更具体,比像素配准更宽松,所以它天然适合做一些既要可解释、又要精确的控制任务。

从颜色到语义:分布级控制的优势

很多人看到“直方图控制”会下意识觉得这不就是调色吗?其实不止。论文里一个很有意思的发现是:当直方图不是从颜色空间来,而是从离散潜在空间来时,控制效果会跟潜在空间编码的内容走。某些 tokenizer 更像在编码颜色和纹理,某些则会带出更高层的语义,甚至还能影响空间结构。也就是说,HIG 不是只会“调色盘”,它还会“摸潜空间的脾气”。
图8:不同图像tokenizer下的潜在直方图控制效果
图8:不同图像 tokenizer 下操控潜在令牌直方图,会得到不同层级的控制效果,比如颜色、纹理、语义甚至结构。说明 HIG 的控制结果不只取决于 OT,本质上还取决于潜在空间本身编码了什么。
这件事对实际工作挺重要。因为很多可控生成方法的问题不是“不能控”,而是“控制粒度太偏”:要么太粗,用户觉得像在许愿;要么太细,模型像被五花大绑。HIG 的价值就在于,它提供了一种分布级控制的中间方案。对需要色彩风格统一、视觉统计一致、或者需要在图像里编码信息的场景,这种控制方式比单纯文本更靠谱。
图4:颜色约束生成定性结果对比
图4:颜色约束生成定性结果对比。图中给出了 HIG 与多种基线在颜色直方图对齐、文本符合度和视觉质量上的表现,能直观看到它不是“只会贴色块”,而是尽量把分布和画面一起照顾到。

无需训练,即插即用:HIG的核心技术揭秘

HIG 的核心不是改模型结构,也不是额外训练一个控制分支,而是在采样时对中间预测结果做显式变换。扩散模型每一步都会先预测一个“干净版本”的图像或潜变量,然后再继续加噪走到下一步。HIG 做的事情很直接:先把这个中间结果解码出来,按目标直方图做一次 OT 变换,再编码回去,继续下一步采样。这个流程看起来朴素,但胜在不改骨架、只插手过程
图3:信息嵌入流程示意图
图3:信息嵌入流程示意图。先把文本通过 soft prompt tuning 压成连续向量,再把这个向量映射成颜色直方图,最后借助 HIG 精确生成并解码图像中的信息。
这里要解释两个关键词。第一是 soft prompt tuning,中文可理解为“软提示微调”,本质上是把原本离散的提示词换成一串可学习的连续向量,用它去“提示”大模型输出目标文本。第二是 OT,也就是最优传输。它解决的是一个很朴素但很关键的问题:怎么把一个分布变成另一个分布,而且花费最小。在 HIG 里,这个“花费”可以理解成颜色改动幅度、token 改动幅度,或者说对原始图像内容的扰动程度。
图2:单选项分箱与多选项分箱示意图
图2再次出现是因为它是这个方法的关键细节。单选项分箱很“硬”,每个桶只有一个值,精度高但容易把图像改得生硬;多选项分箱更像“宽容版”控制,一个桶里保留多个候选值,OT 只负责桶级别对齐,桶内具体落到哪个值可以更灵活,所以更不容易把画面弄坏。
论文里还有一个很实用的判断:OT 不一定每一步都要做很多次。对于颜色分布约束,1 到 2 次引导通常就够了;对于由 soft prompt 生成的合成直方图,通常要 3 到 4 次引导来兼顾质量。也就是说,HIG 不是把扩散过程“掐死”,而是在关键节点上轻轻拨一下方向盘。这个设计很工程化,挺像老司机开车:不乱打方向,但每一下都打在点上。🤨

不只是调色:信息嵌入与潜在空间控制

这篇论文最容易让人“哎呦一下”的地方,不是颜色控制,而是信息嵌入。作者把一段文本先压成 soft prompt,再把这个连续向量映射成目标颜色分布,最后让图像精确承载这段信息。只要直方图对齐足够准,解码端就能把信息恢复出来。换句话说,图像不只是图像,还能当“分布型存储介质”。
图6:信息嵌入定性结果
图6:信息嵌入定性结果。每张图都能嵌入 512 个文本 token,并且可以较稳定地解码出来。对比可以看到,单选项分箱如果直接做 OT,画面容易变脏;加上采样过程中的 OT 引导后,视觉质量明显更稳。
这部分的技术点其实很“硬核但不花哨”。为了让解码可逆,论文把 soft prompt 的范数固定住,再通过一个确定性的映射把向量变成颜色直方图。这样做的好处是,编码和解码之间有了稳定的一一对应关系,不需要额外训练一个复杂的解码器,也减少了信息被图像内容干扰的风险。对于需要高精度隐藏、校验、标记的场景,这种方法比“看起来像藏了点东西”要靠谱得多。
图7:信息嵌入鲁棒性评估
图7:信息嵌入鲁棒性评估。随机缩放、JPEG 压缩、soft prompt 扰动和直方图污染都会影响解码,但在合理范围内,方法仍然能维持较高的恢复率。说明它不是只在实验室里“摆拍”,至少对常见扰动有一定韧性。
不过这里也要客观一点:信息嵌入虽然有趣,但它对图像分辨率、压缩方式、直方图精度都比较敏感。论文自己也承认,越长的文本越难完全恢复,JPEG 压缩这种操作尤其不友好。所以它更像一个高精度分布控制的证明题,而不是已经能大规模上线的隐写产品。这个边界感很重要,不然容易把 demo 当成生产力。

实验结果:精准对齐与高质量兼得

实验部分的核心不是“跑了多少表”,而是验证三个问题:第一,HIG 能不能真的把直方图对齐;第二,这种对齐会不会把图像质量拖垮;第三,它的开销是不是还能接受。论文的实验设计基本围绕这三个问题展开,思路是合理的:先看颜色控制,再看信息嵌入,最后看潜在直方图泛化。
图5:颜色约束生成的更多定性结果
图5:颜色约束生成的更多定性结果。OT 引导能明显缓解直接直方图变换带来的局部伪影,说明“在采样中逐步纠偏”比“生成完再硬改”更自然。
表1:颜色约束生成定量结果
表1:颜色约束生成定量结果。这里比较了直方图距离、文本符合度和美学评分。结果显示,HIG 在直方图对齐上最稳,同时还能保持不错的提示词符合度和视觉质量;相比之下,直接 OT 更容易造成局部失真。
表2:不同控制方法的推理延迟与额外开销
表2:不同控制方法的推理延迟与额外开销。HIG 的额外耗时和常见的 LoRA、ControlNet 属于一个量级,说明它不是“为了精确把 GPU 烧穿”的方案,推理成本仍然比较克制。
从结果看,最值得肯定的不是某个单项指标特别炸裂,而是它把三件事同时做到了:对齐准、画面稳、开销低。这比单纯刷一个指标更有工程价值。尤其是“guidance during sampling”优于“direct OT”这一点很关键,说明控制最好发生在生成过程中,而不是事后修修补补。后处理虽然能把 HistKL 压到 0,但画面也更容易出现硬改痕迹,论文对此没有装糊涂,态度是对的。
表3:信息嵌入定量结果
表3:信息嵌入定量结果。随着嵌入文本长度增加,软提示优化的成功率和最终解码率都会下降,但在 512 个 token 的情况下仍能保持较高准确率,说明这套机制确实有“装得下”的能力。
图8:潜在直方图控制效果
图8:潜在直方图控制效果再次说明,HIG 的“控制对象”不是只限于 RGB 颜色。不同 tokenizer 对信息的编码层级不同,因此同样的直方图约束会带来不同的视觉后果,这也是它有研究味道的地方。
如果把这篇论文放到更大的可控生成版图里看,它的定位其实很清楚:不是替代文本、结构、风格控制,而是补上一个大家经常忽略的空档——分布统计控制。这个空档看似抽象,但在颜色风格统一、图像内容编码、以及某些需要精确统计约束的场景里,恰恰是最有用的那一层。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是扩散模型“想控但控不准”的问题,尤其是全局分布层面的控制。HIG 不是去钉结构,也不是单纯改文本语义,而是要求生成图像满足指定的颜色直方图或潜在令牌直方图,并且尽量少破坏原始生成质量。

最优传输(OT)在这里是什么意思?OT 可以理解成“把一个分布变成另一个分布时,怎么搬最省力”。论文里用它来计算从当前直方图到目标直方图的最小代价变换,所以控制不是拍脑袋硬改,而是有明确的数学目标:既满足约束,又尽量少动原图。

单选项分箱和多选项分箱有什么区别?单选项分箱每个桶只有一个候选值,控制更严格,但更容易带来视觉失真;多选项分箱允许每个桶里有多个候选值,OT 只要求桶级别匹配,桶内可以选更接近原图的值,所以更柔和、更不容易把画面改坏。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把“直方图约束”塞进扩散采样流程里,这个切口挺新,不是常规的文本/结构控制套路。

实验合理度:★★★★☆。对比了颜色对齐、视觉质量、延迟开销和鲁棒性,实验链条比较完整,且能解释为什么采样中引导优于事后硬改。

学术研究价值:★★★★☆。它把分布级控制这件事讲清楚了,还把 OT 和可控生成接起来,对后续做可解释控制、隐写、统计约束生成都有启发。

稳定性:★★★☆☆。颜色控制比较稳,但信息嵌入和潜在空间控制对分辨率、压缩、tokenizer 质量仍然敏感,离“随便拿来就上线”还有距离。

适应性以及泛化能力:★★★★☆。能从颜色直方图扩展到潜在令牌直方图,还能兼容不同 tokenizer,泛化思路不错。

硬件需求及成本:★★★★☆。推理开销和常见控制方法接近,单卡 A100 上可跑,属于能接受的额外成本。

复现难度:★★★☆☆。OT、扩散采样、潜在空间和信息嵌入都不算简单,但方法本身不依赖额外训练,复现门槛主要在工程细节。

产品化成熟度:★★★☆☆。颜色风格控制和局部统计约束有落地可能;信息嵌入更像研究型能力,离大规模产品化还要过鲁棒性和安全性这两关。

可能的问题:精确分布控制很强,但一旦目标分布与内容语义冲突,画质和自然度仍会受影响;潜在直方图效果也高度依赖 tokenizer 质量。


主要参考文献

[1] 本文原论文:Histogram-constrained Image Generation, arXiv:2606.31683v1.
[2] 项目主页:https://maps-research.github.io/hig/
[3] 论文中涉及的扩散模型、最优传输、ControlNet、LoRA、Prompt Tuning 等方法,均按原文引用。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!  

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
HIG这类“精确控图”的方法,群里很适合继续拆:最优传输怎么用、直方图控制值不值得上生产、信息嵌入到底有多稳。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。