← 返回 PaperDaily 视觉与图像

CVPR 2026新国立:先白平衡再调光,跨相机色彩恒常误差大降32%

让大模型当"色偏裁判"?新国立这篇CVPR 2026论文把跨相机白平衡玩出了新花样:不直接回归光照,而是先白平衡、让视觉语言模型判断残留色偏、再迭代修正。四大基准全面碾压现有方法,最差场景误差几乎减半,思路清奇还实用。

CVPR 2026新国立:先白平衡再调光,跨相机色彩恒常误差大降32%
原论文信息如下:
论文标题:
White-Balance First, Adjust Later: Cross-Camera Color Constancy via Vision-Language Evaluation

发表日期:
2026年05月

发表单位:
新加坡国立大学(National University of Singapore),华硕智能云服务(ASUS Intelligent Cloud Services)

原文链接:
https://arxiv.org/pdf/2605.19613.pdf

开源代码链接:
https://github.com/NothingIknow/VLM-CC

演示链接:
https://github.com/NothingIknow/VLM-CC/tree/main/assets/smoke_test


手机拍照最让人上火的场景之一:同一个物体,在不同光源下拍出来颜色完全对不上。白炽灯下发黄,荧光灯下发绿,阴天发蓝。这就是色彩恒常性(Color Constancy)要解决的经典问题——让物体颜色在不同光照下保持一致,说白了就是自动白平衡(AWB)。
传统学习方法打不过这个问题的原因很扎心:深度学习模型在训练时用特定相机的RAW数据,而每台相机的传感器光谱响应特性都不一样。模型学到的颜色映射关系,换一台相机就"水土不服"——训练时用佳能,测试时换索尼,误差立刻飙上去。为了让模型在新相机上工作,要么重新采集标注数据(成本极高),要么做一堆校准(麻烦得要命)。
新加坡国立大学这次提出的VLM-CC给出了一个完全不同的解题思路:模仿人类调白平衡的方式——先靠常识判断场景里什么东西本该是什么颜色,然后不断迭代修正。人类看到一张偏黄的照片,会下意识地想:这里面的白纸应该是白的、人脸应该是粉的、天空应该是蓝的,然后根据这些语义知识把色偏拉回来。VLM-CC做的事情,就是把这一套"语义反馈"流程搬进了视觉语言模型里。
图1:方法核心思想示意。与传统直接预测光照颜色不同,本方法先对图像做白平衡,再通过语义反馈更新光照估计。给定RAW图像,先用当前估计做白平衡,然后让视觉语言模型识别残余色偏;预测的色偏方向驱动色度空间中的方向性更新,产生下一次迭代的细化估计。底部展示了一个示例序列,角度误差从1.03度降至0.60度,最右侧为真值。
图1:方法核心思想示意。与传统直接预测光照颜色不同,本方法先对图像做白平衡,再通过语义反馈更新光照估计。给定RAW图像,先用当前估计做白平衡,然后让视觉语言模型识别残余色偏;预测的色偏方向驱动色度空间中的方向性更新,产生下一次迭代的细化估计。底部展示了一个示例序列,角度误差从1.03度降至0.60度,最右侧为真值。

让AI像人一样"看"颜色:VLM如何解决跨相机白平衡难题

先来想一个很生活化的场景:你在商场里看中一件米色外套,试衣间的暖光灯下明明是温柔的奶咖色,结果买回家在自然光下一看——好嘛,直接变成了灰绿色。手机拍照更是重灾区:同一张白纸,在钨丝灯下发橙,在荧光灯下发绿,在阴天发蓝。相机厂商调了这么多年白平衡,为什么还是翻车?
因为现有的自动白平衡(AWB)算法,说白了就是让模型去"猜"光源颜色。传统学习方法在单一相机上训练,模型学到的其实是"这台相机的RAW值 → 颜色映射"的关系。一旦换一台传感器光谱响应不同的相机,这套映射立刻失效。就像你习惯了用普通话的发音规律去听粤语——完全对不上号。到了跨相机场景,学习方法的平均角度误差蹭蹭往上涨,有些方法甚至比最简单的灰度世界假设(Gray-World)还差。
这时候,新加坡国立大学团队(联手华硕智能云服务)在CVPR 2026上提出了一个脑洞大开的思路:让AI模仿人类调白平衡的方式——先看一眼照片,判断"哪儿不对劲",然后动手修正,再看一眼,再修正,直到颜色顺眼为止。这个叫VLM-CC的方法,直接把颜色恒常性(Color Constancy)从"一步到位的光照估计"变成了"迭代式的语义反馈修正",跨相机效果直接碾压了此前的各路SOTA。
这个思路有意思的地方在于:它没有继续在更深的卷积网络或者更大的Transformer里去卷光照回归精度,而是换了一条完全不同的技术路线——把视觉语言模型(VLM)当作一个"色偏裁判"。裁判不直接报出光源RGB数值,而是告诉你"这张图偏红/偏绿/偏蓝",然后系统根据这个定性反馈去调整光照估计的方向。就像人类摄影师调白平衡时不会盯着色温数值表,而是看画面颜色"顺不顺眼"一样。

从"直接预测"到"迭代修正":VLM-CC的核心思想

传统学习方法是怎么做颜色恒常性的?给模型一个RAW图像,让它直接回归出光照颜色估计ℓ̂,然后对图像做白平衡。一个关键问题是:模型在训练时看到的是特定相机的RAW数据分布,换一台相机,数据分布立刻变了,模型的泛化能力立刻现出原形。
VLM-CC换了一个完全不同的思路:把颜色恒常性从一个回归问题改写成一个迭代反馈问题。每一步迭代中,系统先基于当前光照估计对RAW图做白平衡,然后把结果转换成sRGB色彩空间,交给一个微调过的视觉语言模型去判断:画面里还存不存在明显的色偏?如果有,是偏红、偏绿还是偏蓝?拿到这个定性判断后,系统就在色度空间里把光照估计往对应的方向旋转一个角度。然后重复上述过程,直到VLM说"颜色正了"为止。
图1展示了这个核心思想:先把RAW图做白平衡,然后让视觉语言模型指出残留色偏,色偏方向反过来驱动光照估计更新,不断迭代减小角度误差。
图1:方法核心思想示意。与传统直接预测光照颜色不同,本方法先对图像做白平衡,再通过语义反馈更新光照估计。给定RAW图像,先用当前估计做白平衡,然后让视觉语言模型识别残余色偏;预测的色偏方向驱动色度空间中的方向性更新,产生下一次迭代的细化估计。底部展示了一个示例序列,角度误差从1.03度降至0.60度,最右侧为真值。
为什么这个思路能解决跨相机泛化问题?关键就在于VLM不是在RAW像素层面工作,而是在sRGB空间里做语义判断。VLM看到的是"一张照片里有一面白墙、一棵树、一个人的脸",然后根据它对真实世界的理解来判断颜色是否自然。这种语义层面的判断不依赖于特定相机的RAW分布特征,所以天然具有跨传感器迁移能力。
另外,论文选择预测红/绿/蓝三个离散类别而不是连续RGB值,也是经过仔细考量的。研究发现VLM在描述"这个颜色偏红"这种定性判断时相当可靠,但让它报出具体数值(比如"光源RGB是(0.61, 0.42, 0.28)")就很容易翻车。原因在于大语言模型本质上是离散token预测器,对数字的连续变化不敏感——你让它背圆周率没问题,让它做线性回归就是难为它了。

三步走:白平衡、语义先验与色偏反馈的闭环设计

VLM-CC的完整框架可以拆成三个模块:光照初始化与sRGB转换、语义颜色先验提取、色偏预测与迭代更新。图2给出了整体流程示意。
图2:VLM-CC框架总览。给定RAW输入图像,先用当前光照估计做白平衡,并将结果转换为sRGB供VLM处理。预训练VLM从伪sRGB图像中提取语义颜色先验,识别在中性光下固有颜色可靠的物体。经LoRA微调的VLM根据这些先验预测主导残留光色标签(红、绿或蓝)。光照估计在色度空间中相应更新,并反馈到下一次迭代。这个迭代式语义反馈循环逐步细化光照方向直至收敛。
图2:VLM-CC框架总览。给定RAW输入图像,先用当前光照估计做白平衡,并将结果转换为sRGB供VLM处理。预训练VLM从伪sRGB图像中提取语义颜色先验,识别在中性光下固有颜色可靠的物体。经LoRA微调的VLM根据这些先验预测主导残留光色标签(红、绿或蓝)。光照估计在色度空间中相应更新,并反馈到下一次迭代。这个迭代式语义反馈循环逐步细化光照方向直至收敛。
第一步是光照初始化。论文没有从零开始,而是用最简单的灰度世界假设(Gray-World)作为起点。这个假设认为:一张颜色丰富的自然图片中,所有颜色的平均值应该接近灰色。所以初始光照估计就等于图像像素的平均值归一化结果。虽然这个假设在单一色调场景(比如大片草地、大片木地板)里会失效,但好在后面还有迭代修正兜底,起点差一点没关系。
公式5:光照初始估计
公式5:光照初始估计。其中I(x)表示原始RAW图像在位置x的像素值,Ω为图像像素集合
第二步是语义颜色先验提取。系统用当前光照估计对RAW图做白平衡,然后转到sRGB空间,让预训练的VLM输出一个"可信物体颜色列表"——格式是{物体, 位置, 预期颜色, 理由},比如{"草地, 画面下方, 绿色, 因为草在中性光下是绿色的"}。这份先验列表的作用是给后续的色偏判断提供语义锚点。它让VLM不是凭空猜颜色,而是基于"这个物体本该是什么颜色"来做推理。值得一提的是,先验列表在迭代过程中保持复用,但每N步会让VLM重新审视一次当前图像并更新先验,避免物体被色偏影响导致先验漂移。
第三步是色偏预测与更新。每次迭代中,LoRA微调的VLM结合当前伪sRGB图像和颜色先验,输出一个三分类判断:残留色偏是红、绿还是蓝。这个判断看起来粗糙——只有三个方向——但配合上更新策略就足够精细了:系统不做大步跳跃,而是每次在色度空间里把光照估计往目标方向旋转一个小角度,步长从3度线性衰减到0.1度。
公式4:VLM色偏预测
公式4:VLM色偏预测。输入为当前伪sRGB图像和结构化提示词,输出为{红, 绿, 蓝}三选一的色偏标签
更新公式的几何直观是这样的:当前光照估计是一个3维单位向量,目标色偏方向是另一个单位向量。系统先计算目标方向在垂直于当前方向平面上的投影分量,然后用一个角度A_t在"当前方向"和"投影方向"构成的平面内做旋转。这样每一步都能精确控制修改幅度,不会过冲。
公式8:光照更新公式
公式8:光照更新公式。其中u为归一化的当前估计方向,v为色偏方向在当前估计方向正交平面上的投影(经过归一化),A_t为当前迭代步的旋转角度,随时间线性衰减
还有一个很巧妙的收敛判断机制:系统记录色偏预测序列,如果检测到三个不同色偏标签首次全部出现(比如先判断偏红、再判断偏蓝、再判断偏绿),就说明估计已经在真值附近振荡了,此时把所有步长减半,进入精细化阶段。如果精细化阶段再次出现三个不同标签形成三角振荡,或者达到最大迭代次数T=20,就停止迭代。最终结果是取最后三次估计的几何平均,来抑制小幅振荡。
公式9:最终光照估计
公式9:最终光照估计,取最后三次估计的归一化几何平均
图4展示了一个很典型的修正过程:场景里有大片木色表面,CCMNet被木头的颜色带偏,估计出的光源偏红,结果白平衡后的图像反而发蓝。VLM-CC也遇到了同样的初始化偏差,但通过迭代反馈逐步修正,最终收敛到了0.57度的误差,比CCMNet的结果好得多。
图4:迭代修正过程的定性示例。场景包含大面积的木制表面,导致CCMNet的光照估计偏红,其白平衡结果因而偏蓝。本方法从同样受木头影响的灰度世界初始化出发,通过反馈迭代修正并收敛到0.57度。右侧为色度空间中的轨迹图。最终光照取第9、10、11次迭代的归一化几何平均。
图4:迭代修正过程的定性示例。场景包含大面积的木制表面,导致CCMNet的光照估计偏红,其白平衡结果因而偏蓝。本方法从同样受木头影响的灰度世界初始化出发,通过反馈迭代修正并收敛到0.57度。右侧为色度空间中的轨迹图。最终光照取第9、10、11次迭代的归一化几何平均。
说到训练,VLM-CC采用LoRA(Low-Rank Adaptation,低秩适配)微调策略。LoRA的做法是把预训练权重冻结,在模型各层旁边插入低秩分解的可训练矩阵。这样做的好处是训练参数量大幅减少,也更容易在新任务上适配。论文对Qwen2.5-VL 7B的视觉塔/投影层/语言模型部分别插入了秩为8的LoRA适配器。训练数据是通过光照增强生成的:先把RAW图正确地做白平衡,然后随机把光照方向旋转最多17.5度再加回去,让VLM学会在各种色偏下判断残留色偏方向。损失函数采用标准的语言建模交叉熵损失,也就是让模型在"红/绿/蓝"三个词上正确预测。
公式10:语言建模损失
公式10:语言建模损失函数。由于目标输出是一个颜色词,求和实际只包含一个token的交叉熵项
图3:VLM微调流程。给定RAW图像,先在相机色彩空间中做光色增强,再转换为sRGB。这些图像送入LoRA微调的VLM,采用与推理流程相同的颜色先验提示策略。模型预测主导残留光色(红、绿或蓝),由真实光照方向监督。对色偏标签施加标准语言建模损失。
图3:VLM微调流程。给定RAW图像,先在相机色彩空间中做光色增强,再转换为sRGB。这些图像送入LoRA微调的VLM,采用与推理流程相同的颜色先验提示策略。模型预测主导残留光色(红、绿或蓝),由真实光照方向监督。对色偏标签施加标准语言建模损失。

跨相机泛化能力大比拼:四大数据集全面领先

方法的性能到底如何,还需要用数据说话。论文在四个公开RAW数据集上进行了严格的跨相机评测:Gehler-Shi(佳能单反拍摄的568张图)、NUS-8(8台不同相机的1736张图)、Intel-TAU(佳能、尼康、索尼三台相机的7022张图)和Cube+(佳能550D的2070张图)。评测协议是留一法跨数据集评估——用三个数据集训练,在第四个上测试,确保训练和测试的相机完全没有重叠。
先看Gehler-Shi数据集上的结果(表1)。注意这是完全零样本的跨数据集迁移——训练数据里一台佳能相机都没有。VLM-CC的平均角度误差只有1.52度,而此前最强的CCMNet是2.23度,C5是2.36度。最差25%场景的误差从5.46度大幅降到3.29度,说明VLM-CC不仅是平均表现好,在困难场景下的稳定性也明显优于前人。中位数0.92度、三均值(Tri-mean,即剔除最高最低后的平均值)0.98度这些指标也全面领先。
表1:Gehler-Shi数据集上的留一法跨数据集评估。训练集为Cube+、NUS-8和Intel-TAU,测试集为Gehler-Shi。
表1:Gehler-Shi数据集上的留一法跨数据集评估。训练集为Cube+、NUS-8和Intel-TAU,测试集为Gehler-Shi。
在NUS-8数据集上(表2),VLM-CC的平均误差达到1.83度,低于CCMNet的2.32度和C5的2.54度。同样地,最差25%场景表现大幅领先,从5.18度降到3.88度。这个数据集的挑战在于NUS-8包含了8台完全不同的相机(佳能、尼康、索尼等),跨传感器差异更大。
表2:NUS-8数据集上的留一法跨数据集评估。训练集为Gehler-Shi、Cube+和Intel-TAU,测试集为NUS-8。
表2:NUS-8数据集上的留一法跨数据集评估。训练集为Gehler-Shi、Cube+和Intel-TAU,测试集为NUS-8。
Cube+上的优势相对温和一些(表3):平均误差1.51度对CCMNet的1.68度,提升约10%。但中位数(1.09度对1.16度)、最差25%(3.28度对3.89度)仍然全面领先。值得注意的是,Cube+只有一台相机(佳能550D),数据多样性有限,VLM-CC在这个场景的优势没有被完全拉开。
表3:Cube+数据集上的留一法跨数据集评估。训练集为Gehler-Shi、NUS-8和Intel-TAU,测试集为Cube+。
表3:Cube+数据集上的留一法跨数据集评估。训练集为Gehler-Shi、NUS-8和Intel-TAU,测试集为Cube+。
除了跨数据集测试,论文还做了NUS-8内部的跨传感器评估(表4):在7台相机上训练,在第8台上测试。这种情况比跨数据集的域差异小一些,但VLM-CC依然以1.49度的平均误差领先,GCC和CCMNet分别是2.03度和1.71度。有意思的是,GCC的最差25%误差是3.69度,VLM-CC是2.98度——即使是在这个"更简单的"协议下,VLM-CC的稳定性优势还是很大。
表4:NUS-8数据集上的跨传感器评估。在7台相机上训练,在最后一台上测试。
表4:NUS-8数据集上的跨传感器评估。在7台相机上训练,在最后一台上测试。
论文还报告了标准的三折交叉验证结果(表5)以及NUS-8与Gehler-Shi之间的双向跨数据集泛化结果(表6)。在三折交叉验证中,VLM-CC的平均误差1.34度,超越了C4(1.35度)、CLCC(1.44度)和IGTN(1.58度)等单相机方法——这说明VLM-CC不仅能跨相机泛化,在传统同相机场景下也具备竞争力。表6的结果比较多,这里就不逐一展开了,重点看结论:在NUS-8→Gehler-Shi方向上,VLM-CC以1.52度对CCMNet的2.23度大幅领先;Gehler-Shi→NUS-8方向上,1.83度对2.32度,依然是明显优势。
表5:Gehler-Shi数据集上的三折交叉验证结果。
表5:Gehler-Shi数据集上的三折交叉验证结果。
表6:相机无关评估(Camera-agnostic evaluation),NUS-8与Gehler-Shi双向跨数据集结果,单位均为度。
表6:相机无关评估(Camera-agnostic evaluation),NUS-8与Gehler-Shi双向跨数据集结果,单位均为度。

消融实验揭示:语义先验与迭代机制缺一不可

表7是Gehler-Shi留一法评估下的综合消融实验。几个关键结论值得细品。
表7:Gehler-Shi数据集留一法评估中的综合消融实验。
表7:Gehler-Shi数据集留一法评估中的综合消融实验。
第一组对比直接使用预训练的Qwen2.5-VL 7B而不做LoRA微调,误差高达7.5度。这说明通用VLM虽然"懂颜色",但直接用来判断色偏方向还是差点意思。经过LoRA微调后,误差骤降到1.52度——训练数据的构建方式(把正确白平衡图随机旋转光照角度)让VLM真正学会了识别"残留色偏"这种物理概念。
第二组对比考察了语义先验的作用。去掉颜色先验列表(即直接让VLM判断色偏,不提供"这个物体应该是什么颜色"的提示),平均误差从1.52度恶化到2.19度。最差25%从3.29度恶化到4.63度。这说明VLM的色偏判断确实依赖语义信息来校准——知道"这是草地,草应该是绿的"才能更准确地判断"当前画面是否偏红"。
第三组对比很妙:把迭代机制去掉,只做单次VLM判断。误差同样上升到2.19度。这个结果直接证明了迭代修订的价值——单次判断即使正确,步长控制也很难恰到好处;而迭代方式可以通过小步多次逼近,即使某一步的色偏判断不够准,后续迭代也能修正回来。
还有一个技术细节值得提:把Gray-World初始化和等步长策略换成更精细的线性衰减步长,也能带来约0.1度左右的收益。这说明这个方法的性能上限在很大程度上依赖工程细节的打磨,而不是单靠VLM这一个组件。

总结与展望:VLM驱动的颜色恒常性新范式

VLM-CC的贡献远不止于在几个数据集上刷新了数字。它真正有价值的地方在于,提供了一个利用VLM语义理解能力来解决传统底层视觉问题的全新范式:不是让VLM去预测连续数值,而是让它做自己最擅长的事——语义判断和定性描述,然后通过迭代反馈把定性判断转化为精确的数值估计。
这个思路的启示意义在于:很多底层视觉任务(去噪、超分、去模糊)目前都是"一步到位"的回归范式,模型直接预测输出像素。但如果参考VLM-CC的思路,是否可以改成"生成→评估→再生成"的迭代闭环?让模型先给一个初步结果,再用VLM或者其他评估模型指出哪里不对,然后针对性地修正?这种"第一遍粗做,后面细修"的策略,在图像生成领域已经被证明有效(比如扩散模型的去噪过程本质上就是逐步细化),但在底层视觉恢复领域还很少有人系统地探索。
从工程落地角度看,VLM-CC目前有一个明显的现实约束:推理成本。测试时每次迭代都需要跑一次7B规模的VLM前向传播,最多20次迭代,也就是单张图最多要跑20次7B模型。项目说明中也提到,使用轻量级InternVL3.5-1B模型可以把显存需求压到3GB左右(bfloat16精度),这为低端GPU上的部署留出了一条路。不过推理延迟依然是摆在实时应用面前的一座大山。手机端ISP里的自动白平衡模块目前都是毫秒级响应的,VLM-CC要走进手机,还需要在模型轻量化上做大量工作。
另外一个值得关注的方向是:VLM-CC的训练数据完全来自带真值光照标注的RAW数据集,但它的推理完全不依赖目标相机任何标注。这意味着如果未来有更大规模、更多相机的RAW数据集出现,VLM-CC的性能还有很大的提升空间。而随着VLM基座模型本身能力的增强(更强的颜色感知、更准的物体识别),这套方法的天花板也会被进一步抬高。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?针对跨相机白平衡泛化难题,新加坡国立大学提出VLM-CC框架,创新性地将色彩恒常性重构为迭代感知反馈问题:先白平衡,再让视觉语言模型判断残留色偏方向并迭代修正。
这篇工作最值得看的点是什么?在所有跨相机评估设置中均取得最佳性能,在Gehler-Shi、NUS-8、Cube+数据集上几乎所有指标均优于现有方法,特别是在Worst-25%指标上提升显著,表明方法大幅减少了较大误差案例。
这篇工作的边界或风险在哪里?优点:(1) 创新性地将颜色恒常性重构为基于VLM语义反馈的迭代过程,避免了直接RGB回归的跨相机过拟合问题;(2) 在伪sRGB空间中操作,更好地利用VLM预训练中的语义信息;(3) 离散色偏标签预测比连续数值回归更符合VLM的能力特点…
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出VLM-CC框架,将颜色恒常性重构为迭代反馈过程,利用视觉语言模型提供语义反馈(红/绿/蓝残色偏),在伪sRGB空间中逐步修正光照估计,实现跨相机鲁棒泛化。

实验合理度:★★★★☆

平均角度误差(Mean)、中位数角度误差(Med)、三均值角度误差(Tri)、最佳25%平均误差(B.25%)、最差25%平均误差(W.25%)

学术研究价值:★★★★☆

提出VLM-CC框架,将颜色恒常性重构为迭代反馈过程,利用视觉语言模型提供语义反馈(红/绿/蓝残色偏),在伪sRGB空间中逐步修正光照估计,实现跨相机鲁棒泛化。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

训练在单张NVIDIA H200 GPU上进行800次迭代,测试时最多运行T=20次迭代,步长角度从3°线性衰减到0.1°。

复现难度:★★★☆☆

https://github.com/NothingIknow/VLM-CC

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;(2) 在伪sRGB空间中操作,更好地利用VLM预训练中的语义信息;(3) 离散色偏标签预测比连续数值回归更符合VLM的能力特点;(4) 对初始化方法不敏感,鲁棒性强。缺点:(1) 依赖VLM的推理能力,计算开销较大;(2) 需要相机色彩校正矩阵(…


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球