CIAN的全称是Contextual Image-Article Narrator(上下文图像-文章叙述器),它采用多阶段流水线设计,像一条智能生产线:先检索,再生成,最后精修。第一步上下文检索(Context Retrieval):使用SigLIP模型(Sigmoid Loss for Language Image Pre-training,一种通过sigmoid损失进行视觉语言预训练的模型,提出自Google)对图像进行编码,然后在大规模新闻文章库中找到语义最相关的文章。与传统的图像-文本检索不同,这里追求的是文档级别的检索,因为一篇新闻文章才能提供足够丰富的事件上下文。具体来说,给定查询图像Iq,用SigLIP图像编码器得到嵌入eq,与数据库中所有图像的预计算嵌入进行余弦相似度排序,选出Top-K最相似的图像(K=20)。接着对每张图像对应的候选文章,将其标题和正文分别用SigLIP文本编码器编码,并用加权融合(标题权重λ=0.3)得到最终文章嵌入earticle。最后用eq与earticle的相似度对文章进行重排序,选出最相关的结果。这一步的mAP高达0.979,几乎完美。第二步叙事生成(Narrative Generation):检索到的文章长度往往很长,直接输入到生成模型会引入大量噪声。所以作者先用BART模型(Bidirectional and Auto-Regressive Transformer,双向自回归Transformer,由Facebook提出,用于序列到序列的生成任务)对文章进行摘要,提取最核心的信息。然后以Qwen2.5-VL-3B-Instruct模型(通义千问的视觉语言版本)为基础,通过LoRA(Low-Rank Adaptation,低秩适配微调技术,一种参数高效的微调方法)对模型进行微调。输入是查询图像和摘要文章,配合精心设计的故事化提示(storytelling-oriented prompt),让模型生成初版事件感知描述cstory。图1:CIAN框架的总体概览。流水线包含三个阶段:上下文检索(使用SigLIP模型为每张查询图像检索语义相关的文章)、叙事生成(使用LoRA微调的Qwen模型通过整合视觉和文本信息合成事件感知描述)和基于N-Gram的精炼(增强语言流畅性和领域一致性)。第三步N-Gram精炼(N-Gram-based Refinement):CIDEr(Consensus-based Image Description Evaluation,基于共识的图像描述评价指标)是当前最主流的图像描述自动评测指标之一,它对n-gram(一元、二元、三元)的重叠非常敏感。为了迎合这个指标,作者在训练集所有参考描述中统计高频n-gram,形成一个n-gram词典G,然后再次用Qwen模型(称为QwenRefine)对初始描述进行受控改写,在保持语义不变的前提下加入这些高频n-gram,从而提升自动评测分数。这不是硬性替换,而是一种软约束,所以不会产生生硬的表达。整条流水线就像“先联网查资料,再写初稿,最后请语文老师润色”——逻辑清晰,效果实在。
SigLIP是什么?为什么用它而不是CLIP?SigLIP是Google提出的一种视觉语言预训练模型,全称Sigmoid Loss for Language Image Pre-training。它使用独立的sigmoid损失函数替代了CLIP的对比损失,在训练效率和对齐质量上都有提升。在本文的检索任务中,SigLIP的mAP 0.979全面超过CLIP(0.971)、BLIP(0.940)和DINOv2(0.966)。
[1] Zhai, X., Mustafa, B., Kolesnikov, A., Beyer, L.: Sigmoid loss for language image pre-training. 2023. (SigLIP原论文)[2] Wang, P., Bai, S., Tan, S., et al.: Qwen2-VL: Enhancing vision-language model's perception of the world at any resolution. arXiv:2409.12191, 2024.[3] Hu, E.J., Shen, Y., Wallis, P., et al.: LoRA: Low-rank adaptation of large language models. ICLR, 2022.[4] Lewis, M., Liu, Y., Goyal, N., et al.: BART: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension. arXiv:1910.13461, 2019.[5] Vedantam, R., Zitnick, C.L., Parikh, D.: CIDEr: Consensus-based image description evaluation. CVPR, 2015.[6] Nguyen, H., et al.: OpenEvents V1: Large-scale benchmark dataset for multimodal event grounding. ACM Multimedia, 2025.[7] Tran, T.P., et al.: Event-enriched image analysis grand challenge at ACM Multimedia 2025. ACM Multimedia, 2025.