← 返回 PaperDaily 视觉与图像

中国电信&西安交大最新SOTA!InteractiveAvatar:实时流式生成,视频头像也能听懂你的话

能让数字人听懂你说话的“套路”来了!InteractiveAvatar不仅能把语音转成视频,还能理解“看一下手表几点了”这种复杂意图,并做出相应动作。在长达数分钟的无限流式生成中,画面一致性还吊打一众对手,实时推理速度更是达到26.68 FPS。

中国电信&西安交大最新SOTA!InteractiveAvatar:实时流式生成,视频头像也能听懂你的话
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
能让数字人听懂你说话的“套路”来了!InteractiveAvatar不仅能把语音转成视频,还能理解“看一下手表几点了”这种复杂意图,并做出相应动作。在长达数分钟的无限流式生成中,画面一致性还吊打一众对手,实时推理速度更是达到26.68 FPS。


原论文信息如下:
论文标题:
InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars
发表日期:
2026年06月
发表单位:
西安交通大学, 中国电信人工智能技术(北京)有限公司, 武汉大学
原文链接:
https://arxiv.org/pdf/2606.22905v1.pdf
开源代码链接:
暂无

问题锁定:实时交互头像的两大核心挑战

你可能已经见过不少数字人——对着镜头嘴巴一张一合,念着LLM生成的文本。这些技术确实能做实时流式生成(比如LiveAvatar),但细看总有那么点不对劲:聊上一两分钟,背景开始忽明忽暗,人物的眼镜腿突然变细了,衣服颜色悄悄漂移……这就是 长时视频时序漂移 问题。现有的实时方法大多只盯着最近几帧,加上一张参考图,一旦生成内容偏离初始参考,前后帧的矛盾就会积累,画面就崩了。
但还有更扎心的:你问数字人“帮我看看手表几点了”,它只会像复读机一样把时间念出来,眼神却飘向天花板。这是因为现有方法都遵循 纯音频驱动 范式——只有音频输入,没有用户意图建模。想要生成“瞄一眼手表再回答”这种自然动作,必须认清用户的深层意图,并且把动作指令和语音对齐。而这两件事,过去没有任何一个实时流式系统做得到。
图1: InteractiveAvatar框架概览。它能理解用户意图(如“看一下手表”),在对话中生成语境相关的动作,同时保持长时视觉一致性。
图1: InteractiveAvatar框架概览。它能理解用户意图(如“看一下手表”),在对话中生成语境相关的动作,同时保持长时视觉一致性。
西安交通大学、中国电信人工智能技术(北京)有限公司和武汉大学联合团队,在这篇被收录于2026年某顶会的论文中,提出了 InteractiveAvatar。核心思路是:先解决视觉一致性(用Long-Short Visual Memory,即长短视觉记忆),再解决意图感知(用Reasoning-Reaction Module,即推理-反应模块)。这两招一旦合体,数字人就能在无限流式视频中保持画面稳定,还能听懂你话里的话。
表情

解决方案:Long-Short Visual Memory (LSVM) 机制

要避免视觉漂移,直觉上我们想到让模型记住所有历史帧。但实时流式推理中,把每一帧都存下来既不现实也没必要。InteractiveAvatar的做法是设计一套 Long-Short Visual Memory (LSVM),将历史信息压缩成紧凑的记忆token,兼顾局部连贯性和全局稳定性。
LSVM包含两个缓冲池:短期记忆 (Short-term Memory, M_s)长期记忆 (Long-term Memory, M_l)。短期记忆像一个固定长度的FIFO队列(默认存最近K帧),负责保持帧与帧之间的局部连续过渡;长期记忆则固定容量N,存储从整个生成过程中挑选出的代表性关键帧,确保全局外观一致性。
关键是怎么填充长期记忆?论文提出 动态关键帧选择 (Dynamic Key-Frame Selection, DKFS) 策略。每当短期记忆弹出一帧,系统就用一个轻量级语义提取器(SigLIP2 [27])计算该帧的语义特征向量,再与长期记忆中所有帧的平均余弦相似度对比。如果引入该帧后,长期记忆整体的语义冗余度降低,就把该帧插入长期记忆,否则丢弃。这样,长期记忆总是保持高度多样化的代表帧,从视觉上“覆盖”整个视频内容。
图3: LSVM机制。(a)训练时长期记忆帧随机采样,短期记忆保留所有近期帧。 (b)推理时动态关键帧选择自适应更新记忆,保留重要视觉信息。
图3: LSVM机制。(a)训练时长期记忆帧随机采样,短期记忆保留所有近期帧。 (b)推理时动态关键帧选择自适应更新记忆,保留重要视觉信息。
为了训练记忆压缩网络C(·),论文采用了一种随机掩码重建策略:从完整视频片段中随机选取一些帧作为重建目标,对长时历史区域随机选一帧作为锚点,其余帧掩码;然后再用噪声代替掩码区域,让扩散模型根据压缩后的记忆token去重建原始帧。这种训练迫使模型均衡地编码整个历史——既要保留细节(靠短期记忆中的近帧),又要维持全局一致性(靠长期记忆中的代表帧)。实际推理时,模型只需要在每一步访问压缩后的记忆token即可,计算开销可控。
图中展示了LSVM在训练和推理时的不同流程。训练时长期记忆随机采样,短期记忆保留全部最近帧;推理时通过DKFS动态更新长期记忆。这样,即使生成成千上万帧,画面中物体(比如手表、眼镜)的形状和颜色都不会漂移。

解决方案:Reasoning-Reaction Module (RRM) 模块

光有视觉一致性还不够,数字人必须“懂你”。InteractiveAvatar的第二个精妙设计是 Reasoning-Reaction Module (RRM),它利用大语言模型(LLM,论文中使用的是 [38])来理解用户意图,并管理数字人的状态。
RRM的核心是 State-Cycling(状态循环)策略。当用户语音输入后,ASR转成文本,LLM根据当前稳定状态,同时输出两部分:一个动作状态(包含动作指令 p_act 和回复音频 a_resp),以及一个稳定状态(稳定提示 p_stable)。例如用户说“帮我看看现在几点”,LLM会输出动作指令“avatar glance at watch and then look back”,回复音频“现在是下午三点”,稳定提示“人物坐姿端正,目光自然”。生成时,数字人先执行动作(看表、说话),待音频播放完毕后,动作指令切换回稳定提示,数字人恢复静态姿态。直到用户下一次输入,LLM再次输出新的动作指令,形成“推理-执行-稳定”的循环。
但状态切换时有一个工程痛点:之前的KV缓存是基于旧的动作指令计算的,一旦指令切换,所有缓存的KV都要重新算,这会引入延迟。为此,RRM还配备了一个 Cache-Switching(缓存切换)机制:当动作指令从 p_act^(t-1) 变为 p_act^t 时,只重新计算受影响的前序块的文本条件KV,其他块的KV保持不变。这样,新指令生效的延迟被压缩到几乎不可感知的程度。
图2: InteractiveAvatar整体架构。 (a) RRM模块与用户进行意图感知交互; (b) 流式推理结合LSVM机制增强视觉一致性; (c) DMD训练实现实时流式生成。
图2: InteractiveAvatar整体架构。 (a) RRM模块与用户进行意图感知交互; (b) 流式推理结合LSVM机制增强视觉一致性; (c) DMD训练实现实时流式生成。
整体框架如图2所示。RRM输出文本指令后,经过T5编码器注入扩散模型的交叉注意力层,音频则驱动唇形同步。为了支撑实时流式生成,论文还采用了DMD(Distribution Matching Distillation)蒸馏技术,将Wan2.2 5B这样的大型扩散模型蒸馏成仅需4步(或更少)采样的单步生成器,配合FSDP并行和KV缓存,最终在H100上达到26.68 FPS。
表情

实验结果:实时生成与意图感知两不误

我们来看硬指标。团队收集了约300万高质量音视频片段,包括HDTF、VFHQ、VoxCeleb2、CelebV-Text、AVSpeech、OpenHumanVid以及自采集的对话数据。测试集包含500个交互场景。对比方法包括StableAvatar、OmniAvatar、HYAvatar、Hallo3、EchoMimicV3、WanS2V和LiveAvatar。
表1是定量对比。需要说明几个关键指标:OBJ 衡量物体级别的时序一致性(由Gemini模型评估),TV 衡量生成视频与文本提示的对齐度,ID 衡量身份保持(DINOv3)。可以看出,InteractiveAvatar在OBJ(85.2)和TV(25.93)上全部领先,ID(4.51)也仅次于LiveAvatar(4.53)。且帧率高达26.68 FPS,是所有方法中最快的。注意LiveAvatar虽然ID略高,但OBJ严重偏低(76.9),说明物体级一致性很差(颜色、形状漂移)。
表1: 与SOTA方法的定量对比。最佳加粗,次佳下划线。实验使用H100 GPU。
表1: 与SOTA方法的定量对比。最佳加粗,次佳下划线。实验使用H100 GPU。
再看定性对比(图4)。论文展示了两个场景:第一个是Avatar手腕上带着手表,指令是“看一下现在几点”;第二个是桌上放着一本书,指令是“拿起书并打开”。OmniAvatar完全没按指令动;WanS2V在第一场景中画面随时间严重退化,第二个场景无法执行指令;LiveAvatar虽然响应了指令,但手表的形状和颜色在推理过程中快速变化,物体一致性极差。唯有InteractiveAvatar既执行了正确动作,又保持了手表和书本在整个视频中的外观稳定。
图4: 与SOTA方法的定性对比。本方法在视觉一致性和动作指令遵循上均表现更好。
图4: 与SOTA方法的定性对比。本方法在视觉一致性和动作指令遵循上均表现更好。
消融实验(表2、图5)进一步验证了各模块的有效性。去掉长期记忆(w/o LongMem)后OBJ从85.2降到82.6,ID下降;去掉DKFS(用随机采样代替)导致轻微失真;去掉整个LSVM后OBJ暴跌到78.4。去掉State-Cycling策略后,Avatar会一直重复同一动作(比如不停看表),非常不自然;去掉Cache-Switching后,从“看表”切换成“坐好”的延迟显著增加。去掉RRM后,Avatar退化为只会说话不做事。而去掉DMD蒸馏,帧率直接降到1.27 FPS,完全无法实时。
表2: LSVM、RRM和DMD的消融实验。
表2: LSVM、RRM和DMD的消融实验。
图5: InteractiveAvatar的定性消融。完整模型保持最佳视觉一致性并实现更逼真的交互。
图5: InteractiveAvatar的定性消融。完整模型保持最佳视觉一致性并实现更逼真的交互。
表情

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

问:LSVM中的动态关键帧选择具体怎么实现的?会不会增加额外计算负担?答:推理时,每生成一个新帧,就压缩成token暂存到短期记忆FIFO队列。当队列满时弹出最早一帧,用SigLIP2提取该帧对应真实图像的语义向量。然后将这个候选向量与长期记忆所有向量的平均余弦相似度对比,计算当前长期记忆的冗余度R。如果加入候选帧后冗余度降低,就替换掉长期记忆中冗余度最高的那一帧。整个过程只涉及一次特征提取和简单的向量运算,相对于扩散模型迭代来说几乎可以忽略。

问:RRM中的状态循环策略会不会导致数字人反应迟钝?比如用户说一句话,它要先等LLM推理再执行,会不会有卡顿?答:论文在工程上做了优化:LLM推理与小视频生成可以流水线并行——LLM生成文本指令的同时,之前的音频和动作还在执行。实际端到端延迟主要取决于LLM推理时间(通常几百毫秒)和音频长度,但通过Cache-Switching减少切换动作时的KV重算,整体延迟控制在可接受范围内。实时演示中用户提问后约0.5~1秒即可开始回复。

问:本文用到的Wan2.2模型是什么?为什么要用它做基础模型?答:Wan2.2 5B [30] 是阿里巴巴在2025年开源的一个大规模文生视频/图生视频扩散模型,参数量5B,采用因果3D VAE和T5文本编码。选它是因为Wan2.2已经展示了强大的视频生成质量和丰富的先验知识,论文在此基础上通过蒸馏将其变成适合流式推理的轻量模型,并加入LSVM和RRM扩展。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

LSVM将记忆压缩与流式生成结合,DKFS策略新颖;RRM把LLM与扩散生成深度耦合,状态循环与缓存切换都是实用创新。整体在交互式数字人领域开了一个新方向。

实验合理度:★★★★✰

对标了7个开源SOTA方法(包括最新LiveAvatar),测评指标全面(视频质量、一致性、语义对齐),消融实验覆盖各模块。唯一遗憾是没有与商业系统如HeyGen等对比,因为对方未开源。

学术研究价值:★★★★✰

为视听交互数字人提供了完整的系统级方案,LSVM对长时视频生成有启发性,RRM范式可被后续工作借鉴。但技术积累性较多,核心算法创新不算颠覆性。

稳定性:★★★✰✰

在论文展示的特定场景下表现稳定,但面对极端光照变化、快速镜头切换、大幅度身体动作等极限情况未验证。长期记忆容量有限(N=固定),超出容量后可能遗忘更早信息。

适应性以及泛化能力:★★★✰✰

训练数据包含多人种、多场景,从结果看在不同身份和简单背景上表现不错。但所有实验都是半身说话镜头,全身场景、复杂多物体场景等未测试,泛化能力有待验证。

硬件需求及成本:★★★✰✰

训练需64块H100,普通实验室负担较大。推理需要单块H100(或A100),26.68 FPS基本满足实时,但若部署到消费级显卡(如4090)可能无法达到实时。蒸馏后模型仍需约5B参数量,不算轻量。

复现难度:★★★✰✰

论文未提供开源代码(只有arxiv论文),但方法描述比较详细,包括关键超参数(K=5s,N=128等)。DMD蒸馏步骤复杂,需从Wan2.2预训练权重逐步蒸馏,有一定复现门槛。

产品化成熟度:★★★✰✰

在可控演示中效果惊艳,但距离商用还需解决:多轮对话记忆管理、错误动作的修正机制、更丰富的动作库、端侧部署优化等。当前更像是一个强大的技术demo。

可能的问题:LSVM的DKFS依赖SigLIP2提取语义特征,额外增加了一个模型;如果SigLIP2对某些罕见物体识别不佳,可能影响关键帧选择质量。RRM中LLM输出的动作指令需与扩散模型协同训练,论文未详细说明动作指令的标注数据如何构造。另外,文中没有展示多轮复杂意图(如“先看看手表,然后告诉我今天天气”)下的表现,真实交互可能更复杂。


主要参考文献

[1] Quanyue Song et al., "InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars", arXiv:2606.22905, 2026.
[2] Wan2.2 5B model: https://github.com/Wan-Video/Wan2.2
[3] Yin et al., "LiveAvatar: Real-Time Streaming Avatar Generation with Autoregressive Diffusion", 2025.
[4] CausVid: Real-Time Streaming Video Diffusion via Block-Causal Attention and DMD, 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
想要和懂行的人一起探讨AI前沿技术?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 视频生成+上海+西安交大+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。