← 返回 PaperDaily 视觉与图像

NYU新方法:直方图约束生成,颜色精确到分布

扩散模型已经很会“画”,但要它严格听话,往往得靠额外网络、微调或复杂条件。HIG更狠:直接在推理阶段用最优传输改轨迹,既能控颜色分布,也能玩信息嵌入,还几乎不增加训练成本。

NYU新方法:直方图约束生成,颜色精确到分布
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
扩散模型已经很会“画”,但要它严格听话,往往得靠额外网络、微调或复杂条件。HIG更狠:直接在推理阶段用最优传输改轨迹,既能控颜色分布,也能玩信息嵌入,还几乎不增加训练成本。


原论文信息如下:
论文标题:
Histogram-constrained Image Generation
发表日期:
2026年07月
发表单位:
New York University Shanghai, New York University
原文链接:
https://arxiv.org/pdf/2607.00959v1.pdf
项目链接:
https://maps-research.github.io/hig/

颜色也能“精确”控制?HIG实现像素级的直方图约束生成

图1:HIG整体方法概览图
图1:HIG整体方法概览图。它不是再给扩散模型塞一个更复杂的控制网络,而是直接在采样过程中插手,把中间结果“拧”到目标直方图上。
扩散模型最擅长的是“画得像”,但要它“听话”,往往就开始闹脾气:要么得加额外结构,要么得微调,要么得把条件喂得很细。HIG(Histogram-constrained Image Generation,直方图约束图像生成)走的是另一条路:不盯着局部边缘、姿态或深度图,而是盯住图像的分布,尤其是颜色分布和潜在令牌分布。简单说,就是不要求每一块像素都照抄模板,但要求整体“统计学上必须对”。
这事听起来有点玄,其实很朴素。比如给一张图规定“蓝色多一点、暖色少一点”,传统方法通常只能大概靠风格迁移、提示词或控制分支去猜;HIG则直接把目标写成直方图,让生成结果在统计意义上精确贴合。于是,颜色控制不再是“差不多就行”,而是“该多少就是多少”。这类控制粒度,正好卡在文本提示的全局语义和ControlNet那种强空间约束之间,属于一个以前没被很好占住的中间地带。🤨

不止颜色:从潜在空间到信息隐藏,HIG的“万能”分布控制

图2:单选项与多选项分箱示意图
图2:单选项分箱与多选项分箱示意图。前者每个箱子只对应一个具体值,约束更硬;后者允许每个箱子里有多个候选值,能减少“为了对齐分布而把图像拧坏”的副作用。
HIG最有意思的地方,不是它能控颜色,而是它把“直方图”这个看起来很基础的统计对象,玩出了两个层次。第一层是像素颜色直方图,适合做整体配色约束;第二层是潜在令牌直方图,也就是对图像tokenizer中的离散码本分布下手。后者更像是在潜空间里做统计操控,控制效果会跟tokenizer学到了什么有关:有的偏颜色和纹理,有的偏语义,有的甚至会影响结构。换句话说,HIG不是固定控制一种东西,而是控制“分布本身”。
更离谱一点的是,它还能拿来做信息隐藏。论文里把一段文本先压成一个软提示(soft prompt),再映射成目标颜色直方图,最后让生成图像携带这段信息,之后还能从图像里较准确地解码回来。这里的 soft prompt(软提示)指的是一组连续向量,不是离散文本 token;Prompt Tuning(提示调优)则是一种参数高效微调方法,核心是只学这组连续提示,不动大模型主体。也就是说,HIG把“图像颜色分布”变成了一个可编码、可解码的信息载体,思路相当野。
图3:信息嵌入工作流示意图
图3:信息嵌入工作流示意图。先把文本压成软提示,再把软提示映射成目标直方图,最后靠HIG把这份统计约束写进图像里。
这就解释了为什么论文反复强调“分布控制”而不是“局部控制”。局部控制更像是拿尺子去量每一块砖头;分布控制则像是规定一栋楼的材料配比。前者细,后者稳,而且更容易和别的控制手段拼装。HIG的定位恰好是中间层:比文本提示更精确,比边缘/姿态控制更灵活。对很多实际场景来说,这种中间粒度反而最有用,因为既不想完全放飞,也不想把生成过程锁死。

核心揭秘:如何用最优运输“微调”扩散模型的每一步?

表格截图:直方图匹配的核心公式与约束
表格截图:直方图匹配的核心公式与约束。HIG把“源直方图到目标直方图”的变换写成最优运输问题,核心是既要对齐分布,又要让改动代价尽量小。
HIG的核心不是“改模型”,而是“改中间结果”。扩散模型在每一步都会预测一个更干净的中间图像,通常再往前走一步继续去噪。HIG就在这个中间环节插一脚:先把中间预测解码成图像或token,再做一个变换,再重新编码回去,最后继续采样。这个设计非常克制,像是只动方向盘,不拆发动机。
这里的关键工具是最优运输(Optimal Transport,OT)。它本来是研究“如何用最小成本把一堆沙子搬成另一堆沙子”的数学工具,放到这里就是:如何用最小的改动,把源直方图搬成目标直方图。OT会输出一个运输计划,告诉系统每个源bin该往哪个目标bin转多少质量。这样一来,目标直方图能被严格满足,而不是“差不多像”。
论文里给了两种分箱方式。单选项分箱很硬,每个bin只有一个具体颜色或token,优点是精确,缺点是容易把图像改得有点僵。多选项分箱则更像“一个箱子里放几个候选”,OT只要求箱子级别的质量对齐,箱内具体选哪个更灵活,于是视觉失真会小很多。说白了,单选项是“严格执行”,多选项是“严格执行但允许灵活走位”。
图4:扩散采样中的显式变换流程
图4:扩散采样中的显式变换流程。HIG不是修改网络参数,而是在采样时对中间预测做解码—变换—编码循环,再把结果送回扩散轨迹。
这套流程为什么能工作?因为它只在少数采样步里做轻量干预,而且干预是“最小代价”的。OT保证了变换尽量贴近原轨迹,不会把扩散模型辛辛苦苦学来的图像先验一脚踹飞。论文还明确提到,HIG是训练自由的,推理开销也很小;在1024分辨率、50步采样下,额外成本和常见ControlNet、LoRA控制方法大致一个量级。对于工程实现来说,这一点很关键:只要不是又慢又难调,很多方法才有资格进产品候选池。
更妙的是,HIG并不要求目标直方图一定来自参考图像。它还可以来自连续向量。论文里把软提示映射成颜色直方图,本质上是在把“连续空间里的信息”压成“可控的统计形状”。这也是为什么它能做信息嵌入:只要直方图能精确对上,解码时就能把这份信息再读回来。这个思路有点像把秘密消息藏进一张图的“配色习惯”里,而不是藏在肉眼可见的角落里。😏

“零样本”的魔法:HIG如何不训练就实现精准控制?

“零样本”在这里不是噱头,而是实打实的工程优势。很多可控生成方法效果不错,但代价是要训练额外模块、准备专门数据、甚至为不同控制目标单独适配。HIG则直接复用现成扩散模型,只在推理时插入一个基于OT的变换。换句话说,模型本体不用重训,控制逻辑像外挂一样接上去就能用。
这带来的好处很现实。第一,部署门槛低,不用给每种控制场景准备单独训练管线;第二,兼容性强,论文明确说它可以和LoRA、ControlNet这类方法叠加;第三,解释性更好,因为目标约束就是一个直方图,出了问题也更容易定位到底是分箱、OT计划还是解码器不稳。对于产品团队来说,这种方法的吸引力往往比“又涨了几个点”更实在:它能少折腾很多次。
图5:颜色约束生成的定性与定量结果
图5:颜色约束生成的定性与定量结果。HIG在直方图对齐、提示词贴合和美学质量之间取得了比较均衡的结果,而且OT引导能明显缓解“直接变换”带来的局部伪影。
图6:OT引导缓解视觉伪影
图6:OT引导缓解视觉伪影。相比先生成再硬改,采样阶段边生成边引导,图像更自然。
论文在颜色约束任务上做了很完整的对比:包括不加控制的生成、LoRA+ControlNet+IP-Adapter叠加方案、各种风格迁移方法、以及HIG的不同变体。结果比较清楚:HIG在直方图匹配上最稳,提示词贴合也没掉太多,美学分数还保持得不错。更重要的是,直接在采样中做OT引导,比事后把图像硬改成目标直方图更自然,因为后者容易出现局部不连贯、颜色块突兀的问题。这个结论很朴素:先把路走对,比事后扶墙补救强得多。
图7:信息嵌入定性结果
图7:信息嵌入定性结果。单选项分箱下,OT引导能显著减少伪影;多选项分箱下,图像看起来更接近普通生成结果。
表3:信息嵌入定量结果
表3:信息嵌入定量结果。短文本几乎可以做到接近满分解码,512个token时仍能保持较高精确率,说明“把信息藏进直方图”不是摆设。
信息嵌入这部分更像是HIG的“性能秀”。论文用软提示把文本序列压成可控的颜色分布,再让生成图像承载这份信息。结果显示,32到256个token的嵌入/解码成功率都非常高,512 token时虽然难度明显上升,但仍保持在较高水平。这里真正值得注意的不是“能嵌多少字”,而是它证明了一个事实:只要约束足够精确,图像分布本身就能成为一种可编解码的载体。
鲁棒性实验也挺有意思。缩放下基本还能扛,JPEG压缩会更伤一些,说明这类编码对图像后处理比较敏感;如果直方图分箱有少量噪声,效果还能维持。这其实也在提醒一个现实问题:HIG的“精确”主要建立在生成链路尽量完整的前提下,一旦图像被二次处理,统计约束就可能松动。能用,不代表可以随便拿去做链路很脏的场景。
图8:不同图像tokenizer上的潜在直方图控制效果
图8:不同图像tokenizer上的潜在直方图控制效果。控制结果会随潜在空间的语义能力变化,说明HIG的表现并不是“只看算法”,还强依赖底层tokenizer学到了什么。
潜在直方图这部分则把HIG的边界说得很明白:不同tokenizer的潜空间不一样,控制效果也不一样。有的更像颜色控制,有的会带出语义,有的对结构更敏感。OT本身只负责“怎么最省成本地搬运分布”,但搬运之后图像长什么样,还得看潜空间和解码器够不够稳。这一点非常重要,因为它直接告诉读者:HIG不是万能药,它是一个很强的控制框架,但最终效果仍受底座模型的表达方式限制。

未来可期:HIG开启分布控制新范式,为可控生成带来新思路

HIG最值得留下的,不只是几个实验结果,而是一个很清晰的观点:可控生成不一定非要在“文本语义”和“局部结构”之间二选一,分布级控制也可以成为一条正经路线。它的优势在于轻量、可解释、训练成本低,适合和现有控制方法拼接;它的短板在于对分箱、OT求解和底层tokenizer稳定性都比较敏感,尤其是涉及信息隐藏时,后处理和压缩会带来明显影响。
如果把视角放到工程落地,HIG比较像一个“能插进现有管线的控制层”。它不抢主模型的戏,也不强行重训大模型,而是在采样时做分布修正。这种思路很适合需要精细配色、品牌视觉约束、内容水印或隐写的场景。但如果场景要求极强的鲁棒压缩、跨平台重编码或者严格的安全对抗,那就不能太乐观,毕竟统计约束一旦被后处理打乱,精确性就会掉。
更长远地看,这篇论文的价值在于提醒大家:控制信号不一定越密越好,分布本身也可以是高效的控制接口。未来如果能把这种思想扩展到更复杂的统计约束,比如局部-全局联合分布、跨模态分布对齐、甚至视频时序分布控制,HIG这类方法会更有想象力。现在它还只是一个漂亮的起点,但这个起点足够扎实。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“如何让扩散模型按用户指定的统计分布精确生成”。以前更多是控制语义或局部结构,HIG则把颜色直方图、潜在令牌直方图这些分布约束直接写进采样过程。

OT到底是什么意思,为什么它这么关键?OT是最优运输(Optimal Transport),可以理解成“用最小代价把一种分布搬成另一种分布”。HIG靠它保证目标直方图被精确满足,同时尽量少破坏原图内容。

单选项分箱和多选项分箱有什么区别?单选项分箱每个bin只有一个候选值,控制更精确但更容易带来伪影;多选项分箱允许每个bin有多个候选值,能在保持分布约束的同时减少视觉失真。

如果还有哪些地方想继续深挖,欢迎在评论区继续问,分布控制这条线其实还有不少可以玩的东西。

龙哥点评

论文创新性分数:★★★★☆。把最优运输直接引入扩散采样做分布级控制,这个切入点挺新,不是常见的“再堆一个控制分支”。

实验合理度:★★★★☆。对比了多类控制和风格方法,既看效果也看开销,整体比较完整;但信息隐藏和潜在直方图的边界还可以再做得更严谨。

学术研究价值:★★★★☆。它提出的是一种新的控制粒度,能启发后续做统计约束、分布编辑和可解释控制的人继续往下挖。

稳定性:★★★☆☆。颜色约束较稳,但对分箱、解码器和后处理敏感,信息嵌入对JPEG这类扰动也不算特别硬。

适应性以及泛化能力:★★★★☆。能扩到颜色、潜在令牌、信息嵌入,甚至可兼容不同扩散模型,泛化方向不错。

硬件需求及成本:★★★★☆。推理额外开销不大,和常见控制方法相近;但OT求解和高分辨率下的开销仍要考虑。

复现难度:★★★☆☆。思路清楚,但涉及OT求解、分箱策略和不同tokenizer,细节不算特别省心。

产品化成熟度:★★★☆☆。适合颜色约束、视觉水印、信息嵌入等特定场景,离“大而全”的通用可控生成产品还有距离。

可能的问题:精确性强但鲁棒性不算硬,后处理和压缩会影响解码;潜在空间控制的效果也强依赖底层tokenizer,边界条件还需更多验证。


主要参考文献

Haoming Liu, Yuanhe Guo, Yijia Cao, Shenji Wan, Hongyi Wen. Histogram-constrained Image Generation. arXiv, 2026.
Project page: https://maps-research.github.io/hig/
Paper: https://arxiv.org/pdf/2607.00959v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
HIG这类“推理时精确控制”的论文,最适合放进群里边看边拆:方法、实验、坑点,一次讲透。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。