Hist2Style:CVPR 2026,1.5M参数实时4K逼真风格化调色
摄影后期调色还在手动拉曲线?Hist2Style把大型图像编辑模型“压缩”成一个1.5M参数的轻量网络,用直方图作为控制界面,让你像调音量一样调色调。在用户研究里,它赢了82%的对比试验,而且支持实时4K处理,简直是调色师的效率神器。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
摄影后期调色还在手动拉曲线?Hist2Style把大型图像编辑模型“压缩”成一个1.5M参数的轻量网络,用直方图作为控制界面,让你像调音量一样调色调。在用户研究里,它赢了82%的对比试验,而且支持实时4K处理,简直是调色师的效率神器。
你是不是也遇到过这种尴尬:下载了一个精美的3D模型,结果纹理一放大全是马赛克,UV接缝处裂开得像补丁?传统图像超分模型拿到纹理图上直接翻车,生成模型又一味“自由发挥”不保留原细节。浙大团队这次祭出Texture++,用“自适应视角+四叉树掩码+局部单步扩散”三板斧,既保真又无缝,4倍超分PSNR飙到37.53,比SOTA高出1.5个dB,关键是——不需要梯度
超分辨率论文很多,但大多还是“算一次就交卷”。这篇 ThinkSR 的有意思之处在于,它把连续思考机器搬进了像素重建里,让模型可以一边想、一边补细节,而且四个思考步内就能看到稳定变清晰的轨迹。更关键的是,它不是只讲概念,确实把稀疏思考和密集输出之间的矛盾拆开了。
一张图到底“信息多不多”,以前多靠经验拍脑袋。ERank更狠:冻结编码器跑一遍,就能把图像从“平淡”排到“丰富”,而且在超分和OCR的数据筛选上真能派上用场。
这篇工作不靠大模型、不拼训练数据,直接用“先调亮、再增强”的老办法把眼底图像做得更稳。更关键的是,它不是只在一张图上好看,而是把 DRIVE、STARE、CHASEDB1 三个数据集都跑了一遍,还给出统计检验和筛查速度,落地味道很足。
掌脉识别最烦的不是“认错人”,而是图像本身先把自己搞得像一团雾。本文把低对比度增强和特征匹配过滤串成一条完整链路,在三套数据上把效果、泛化和工程代价都讲得比较实在,值得认真看。
这篇工作最有意思的地方,不是又堆了一个更大的超分模型,而是先问了一句很朴素的话:同样是低清图,凭什么都用同一套力气修?DDR-SR把“难图重修、易图轻修”这件事做成了可路由的系统,思路很工程,也很实用。
这篇工作很“朴素”,但不空。它没有靠大模型堆参数,而是把低光照增强里最容易被忽略的几个老问题——大气光估计不准、透射率细节糙、结果容易发灰——逐个拆开处理。思路偏传统,但工程味很足,适合想看物理模型怎么落地的人。
视频修复最难的不是“修清楚一帧”,而是“修完一整条还不闪”。LPM把数据、训练、推理和部署一起打通,直接做到工业级落地,还顺手把带宽成本打下来了,属于论文里少见的真能进生产线的狠角色。
低光增强最怕的不是“亮不起来”,而是“亮起来还把颜色搞脏了”。这篇 TCA-Net 盯住的正是这个老大难:强度和色度怎么可靠再融合,思路很工程,结果也够实在。
这篇工作不玩花活,专盯RAW无损压缩里最容易被忽略的“对齐”问题。看似只是把亮度样本挪一挪,实际却能让CfL预测更稳,JPEG XS里也更能省码率。
这篇论文很实在:不追求大模型堆参数,而是盯着视频通话最真实的痛点——带宽不够、画面糊、还得实时。它用少量人脸帧就能快速训练一个CPU可跑的增强模型,属于“能落地”的那种小聪明。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球