← 返回 PaperDaily 视觉与图像

阿里7B开源原生音视频生成:2K级效果对战33B大模型

视频生成卷到今天,画面早就不稀奇了,但大部分模型要么不出声,要么声音是后期硬贴上去的。阿里DreamX团队直接把声音和画面“打包生成”,还只用了7B参数就敢对标22B/33B的大块头,并且开源了2K精炼器,值得想搞多模态生成的朋友细品。

阿里7B开源原生音视频生成:2K级效果对战33B大模型

paperdaily_reaction_gif


原论文信息如下:
论文标题:
DreamX-Creator 1.0: 让原生音视频生成走向2K分辨率的开源之路
发表日期:
2026年08月

发表单位:
阿里巴巴集团 DreamX 团队

原文链接:
https://arxiv.org/pdf/2608.31106v1.pdf

开源代码链接:
论文中提及公开释放7B生成器与2K Refiner权重,具体代码仓库见原文说明

打开一段AI生成的视频,画面流畅、构图精美,但声音不是没有,就是跟嘴型、动作完全对不上——这种“默片式”体验,相信不少玩过AI视频的朋友都深有感触。市面上主流的视频生成模型,要么干脆不生成音频,要么把音频当作后期处理的附加任务,先出画面、再配声音。这样做出来的视频,声音和画面常常貌合神离,打斗场面没有碰撞声,说话的口型和台词对不上,风吹草动和背景音乐各玩各的。
这背后的问题,本质上是音频和视频在生成过程中缺乏真正的双向交互。如果画面里的人物正在说话,嘴唇的闭合频率直接影响语音的节奏;如果画面上一个花瓶正在坠落,碎裂的声音必须和撞击瞬间严格同步。这种“视听联动”的物理规律,决定了音频和视频不能简单地看作两个独立生成任务的拼接。
这一次,阿里巴巴DreamX团队带来了他们的答案——DreamX-Creator 1.0,一个把音频和视频在生成过程中原生“绑定”的联合生成系统。更让人意外的是,这个系统的核心生成器只有7B参数,却能在多项指标上叫板22B甚至33B参数的大模型,并且官方直接把生成器和2K精炼器都开源了。这不只是技术演示,而是实打实地把原生音视频生成的门槛往下拉了一大截。
先看图1,感受一下DreamX-Creator 1.0整体想要达成的效果:一个原生联合生成器,把视觉运动、语音、音效和环境声全部耦合在一起,后面再接上一段多模态强化学习和2K精炼,最终输出高分辨率且音画同步的视频。

从7B参数到2K分辨率:DreamX-Creator如何实现原生音视频联合生成

图1:DreamX-Creator 1.0系统概览
DreamX-Creator 1.0系统概览。一个原生联合生成器耦合了视觉运动、语音、音效与环境声,随后经过多模态后训练和面向2K的视频精炼阶段。
DreamX-Creator 1.0的核心设计思路,可以用一句话概括:不搞后期配音,不做先画后补,让音频和视频在同一个生成过程中互相“看着对方”一起长出来。为此,团队构建了一个基于扩散Transformer架构的双流联合生成器,一套覆盖数据清洗到能力组织的音视频数据系统,以及一条包括强化学习和2K精炼的完整训练pipeline。
论文中有一张非常清晰的pipeline总览图(图2),把整个系统串了起来:左边是原生联合生成,中间是音视频强化学习后训练,右边是自回归1步2K精炼。三部分独立成章,又首尾衔接。
图2:DreamX-Creator 1.0整体pipeline
DreamX-Creator 1.0完整pipeline,包括原生音视频联合生成、音视频强化学习后训练和自回归1步2K精炼。
先看架构层面的核心设计。DreamX-Creator 1.0的视频流和音频流各自保留独立的token率、位置编码和Transformer主干,在网络前半段完全独立处理,避免低层特征互相干扰;到了后半段,才引入成对的音频到视频(A2V)和视频到音频(V2A)交叉注意力路径,让两条流开始真正意义上的信息交换。这种“先分后合”的设计,既保留了模态特有的表征,又让高层语义能够互相校准。
音频和视频的token率不一样,怎么在交叉注意力里对齐位置?DreamX-Creator 1.0的解法是把两种模态的位置映射到一个统一的时间坐标系,然后对交叉模态的query和key施加时间旋转位置编码(temporal RoPE)。这样既不用重采样任何一方的隐序列,又让注意力天然具备时间感知能力。
更关键的是,训练的时候每个样本可以分配一个方向模式:A2V(音频更干净,视频更嘈杂,让视频向音频学)、V2A(反过来)或Joint(两端噪声水平一致,双向同时交换信息)。在公式上,方向掩码和噪声相对大小的关系可以这样理解:
当视频噪声 σv 大于音频噪声 σa 时,走A2V路径,掩码 m_av = 1, m_va = 0;当 σa > σv 时走V2A路径;两者相等时走Joint路径,掩码全为1。同时,交叉注意力中还对被“指导”一方的源隐状态施加stop-gradient,避免目标流的损失反向传播时把条件流的骨干带偏,但注意力参数本身仍然可训练。
这几种模式在训练时是混合使用的,推理时并不会让用户去选择“A2V”还是“V2A”,它们只是内部的条件配置,不影响对外接口的统一性。

门控交叉模态注意力:让视频和音频在生成过程中真正"对话"

有了A2V和V2A两条交叉注意力路径,下一个问题就是:如何控制信息交换的强度?整个网络很深,每一层的注意力头对不同内容、不同位置的敏感度差异很大。有的层可能需要强硬地让音频去对齐嘴唇运动,有的层只需要轻微感知一下环境音的存在感。如果所有的交叉注意力都一视同仁地全力输出,很容易把某一方的特征“冲垮”。
DreamX-Creator 1.0给出的方案是Gated Cross-Modal Attention(门控交叉模态注意力)。它的输出门不是简单地只看目标token的query,而是同时依赖目标token本身的特征和交叉注意力计算出来的上下文向量,两者共同决定每个注意力头输出的缩放比例。公式上可以简化为:
对于目标流中的第 i 个token和第 h 个注意力头,门控值 g_i,h = sigmoid(W_x · LN(x_i) + w_cT · LN(C_i,h) + b_h)。其中 x_i 是目标token的原始隐状态,C_i,h 是当前头的交叉注意力输出。sigmoid函数把结果压到0到1之间,门的取值既包含目标token自身的语义,又包含跨模态上下文的信息,而且每个注意力头都有一个独立的偏置 b_h。
最终,每个头的输出 C_i,h 先乘上门控值 g_i,h,再做拼接、输出投影和残差连接。论文中特别强调,方向掩码和门控作用在不同层面:方向掩码决定整条A2V或V2A路径是否参与,门控只负责调节被激活路径内部每个注意力头的输出强度。前者是路径开关,后者是音量旋钮。
图5给出了联合生成器的完整架构。左半部分是双流独立处理阶段,右半部分展示了gated A2V和V2A交叉注意力如何交互。
图5:联合音视频生成器架构
图5:联合音视频生成器的架构。两条流在前半段独立处理,后半段通过门控A2V与V2A交叉注意力进行交互。
光有架构还不够,数据是联合生成模型的另一个命门。视频和音频的配对质量直接决定了模型能不能学到真正有用的跨模态关联。如果训练数据里大量存在“画面里人在弹吉他,背景音乐却是交响乐”这种错位内容,模型的输出大概率也会四六不靠。
因此团队设计了一套完整的音视频数据系统,流程如图3所示:先收集多源异构数据,再经过场景切分、质量过滤、跨模态对齐评估,然后生成结构化多模态标注,最后按能力维度组织成不同的数据池。
图3:数据系统概览
7B参数,在动辄几十B起步的视频生成赛道上,确实算得上一股清流。但 DreamX-Creator 1.0 敢用这个小身板挑战 22B、33B 的大块头,底气不只是来自模型结构,更来自一套被认真设计的数据系统。
表2:面向音视频生成的能力导向数据池
表2:能力导向的音视频生成数据池。语音对话、动作拟音、环境音乐和一般电影感内容被划分到不同数据池,以匹配不同的跨模态监督模式。
数据系统第一步是收集。论文把 Koala-36M、VGGSound、AudioSet、OpenHumanVid、SpeakerVid-5M、Action-100M、Talker-T2AV 这些公开数据集,加上内部采集的数据整合到一起,覆盖了语音、动作、物体交互、交通、自然声等各种内容域。
但原始视频嘈杂、弱对齐、音视频内容高度不均衡,直接拿来训练等于给模型喂毒。所以第二步过滤很关键。论文先用 PySceneDetect 在场景边界处做切分,按音频 RMS 能量去掉静音段,再把每个片段两端各裁掉三帧,避免场景边界定位不准带来的跨镜头污染。接下来是一套多维质量评估:视觉感知质量用 Q-Align,运动幅度用基于 UniMatch 的光流估计,音频质量用 Audiobox Aesthetics。跨模态时间对齐则用 Synchformer 做整体评估,那些带可见语音的片段还要额外通过 SyncNet 的唇形同步检查。
过滤完之后是结构化多模态标注。这里有个细节值得注意:论文用 Qwen3-Omni-30B-A3B-Instruct 对视频和音频做联合分析,而不是像一些已有 pipeline 那样把两个模态分开描述再合并。联合理解的好处是视觉和听觉证据能互相校验——画面是火车站,音频就不可能被标注成海边,跨模态幻觉被大幅压缩。再辅以 Qwen3-ASR-1.7B 做语音转写,最后由 Qwen3.6-27B 把多模态标注和转写整合成既保留时间结构、又包含口语内容的流畅 caption。
最后一步是数据组织。论文不搞均匀采样,而是让 Qwen3.6-27B 根据每段clip的主导跨模态监督类型,把数据划分成四个能力池(如表2):语音对话池提供细粒度的嘴型和发声运动监督,动作拟音池提供强时间对齐的音效监督,环境音乐池提供场景级声学监督,一般电影感池则提供混合跨模态依赖的宽泛监督。这样做的好处是,训练时可以按能力目标定向配比数据,而不是在异构语料里碰运气。
图4:训练数据内容分布
图4:训练数据的内容分布。语音占45.0%,事件声音占33.4%,其余覆盖音乐、自然声和混合内容。
从图4的数据分布可以看到,语音和事件声音合起来接近八成,这正是原生音视频生成里最难啃的骨头——音频不是背景板,而是需要跟画面严格对齐的语义载体。数据系统把这两块做成主力,等于从源头保证了模型能学到真正有价值的跨模态关联。可以说,DreamX-Creator 1.0 的 7B 参数能撑起这样的表现,一半功劳得算在这套数据系统上。

门控交叉模态注意力:让视频和音频在生成过程中真正"对话"

引言部分已经聊了双流架构和 A2V/V2A/Joint 三种训练模式,这里再往深挖一层:交叉注意力到底怎么把信息递给对方,才不会把模态自身的特征冲垮?
整条网络很深,不同层、不同注意力头、不同token对跨模态信息的敏感度差异极大。有的层需要强硬地把音频拉到嘴唇运动上,有的层只需要轻微感知环境音的存在感。如果所有交叉注意力都全力输出,结果大概率是某一方的特征被对方“带跑偏”。DreamX-Creator 1.0 的解法,是一个token级和head级的sigmoid输出门
门控交叉注意力公式
门控公式的核心:g_i,h 由目标token x_i 和当前注意力头的输出 C_i,h 共同决定。
公式里 W_x 把目标token的归一化隐状态映射成每个头一个门控logit,w_c 则把该头归一化的注意力输出压成一个标量,b_h 是每个头独立的可学习偏置。目标token的特征和跨模态上下文向量,两者共同决定这个头最终的输出强度。这里的“双依赖”是有讲究的:只看query(目标token)的门控,无法感知当前上下文里跨模态信息到底可不可信;只依赖上下文又可能忽略目标位置自身的语义。两者结合,门控才能动态调节信息交换的强度。
交叉注意力计算
交叉注意力计算细节:Q、K经过共享时间坐标系中的旋转位置编码,M_y 掩码遮挡padding位置。
在门控之前,还有一个关键设计——时间感知的交叉注意力。视频和音频的token率不同,直接做注意力位置对不齐,所以论文把两种模态的位置映射到一个统一的时间坐标轴上,对交叉模态的Q和K施加temporal RoPE(时间旋转位置编码)。这样既不需要重采样任何一方的隐序列,又让注意力天然知道“现在该对齐哪个时间点”。
最后要理清一个容易混的概念:方向掩码和门控作用在不同层面。方向掩码决定整条A2V或V2A路径是否参与计算,是一个路径开关;门控则只负责调节被激活路径内部每个注意力头的输出强度,是一个音量旋钮。开关控制“和谁对话”,旋钮控制“说多大声”。论文里还特意强调,门控不是token路由,也不做路径选择,它只是输出调制。

渐进式训练+强化学习:三步打造高质量音视频生成器

架构和数据都到位了,怎么把这套双流系统真正训练起来?DreamX-Creator 1.0 走的是一条渐进式路线,三个训练阶段各有分工。
阶段一是基于LoRA的音视频预训练。从模态专用的视频、音频骨干初始化,前半段网络完全冻结,后半段挂上rank-256的LoRA适配器,交叉注意力模块和门控直接优化。这样做的意图很明确:优先让两个模态“学会对话”,而不急着大规模改动各自底层的视觉、听觉特征。
阶段二是全参数音视频预训练。把LoRA权重合并回骨干,两个扩散Transformer骨干和所有交叉模态模块一起联合优化。此时模型开始全面适配“音视频联合生成”这个任务。阶段三是高质量微调,用OmniShotCut做细粒度镜头边界检测和转场标注,丢弃含镜头切换的片段,再结合同步指标、双模态美学分数、空间分辨率和时长做筛选,最后在保留的高质量数据上微调。微调阶段把音频损失的权重从0.5降到0.1,让训练更偏重视觉质量的主导地位。
流匹配插值公式
两个模态各自用独立的噪声,通过插值得到带噪隐变量,目标是预测速度场。
流匹配损失公式
训练目标采用token级和特征级归一化的流匹配损失,两个模态按λ_v和λ_a平衡。
训练目标用的是流匹配(Flow Matching):两个模态各自从独立的高斯噪声出发,插值到干净隐变量,模型预测速度场,损失就是预测速度场和真实速度场的均方误差。这套目标让两个模态在统一的框架下各自学好自己的分布,同时通过交叉注意力互相对齐。
但流匹配损失学的是数据分布,并不直接优化人类感知。画面清晰不代表构图美、声音同步不代表语义一致。所以论文加了一个音视频强化学习阶段,用多模态反馈来对齐人类偏好。
图6:模态感知的强化学习
图6:模态感知的音视频强化学习。视频专属奖励和音频专属奖励被路由到各自对应的流,共享的音视频同步奖励则同时优化两条流和它们的跨模态交互。
这里有个很聪明的设计:模态感知的多模态反馈。在音视频任务里,一个候选样本可能视频质量很高但音频很烂,或者两个模态都还行但事件时间完全对不上。如果只用单一全局奖励,某个模态的进步很容易掩盖另一个模态的退化。所以论文把优势分解成视频专属优势A_v、音频专属优势A_a和跨模态优势A_av,路由规则简单而直接:
优势路由公式
视频流接收视频专属优势加跨模态优势,音频流接收音频专属优势加跨模态优势。共享的跨模态优势让同步优化成为两条流的共同目标。
为了进一步强化同步,论文还把V2A注意力响应当作视频token的跨模态相关性信号,计算每个token在同步中的贡献权重:
同步区域加权公式
权重按帧内归一化,α_e在训练预热中从0逐渐增大。前期权重接近均匀,后期逐步聚焦到对音视频同步贡献最大的区域(比如说话的嘴、发出声音的物体)。
除了区域加权,论文还用了深度依赖的梯度缩放:A2V路径进入音频流的梯度,在浅层网络中衰减更明显,到深层交互块才逐步恢复。这样可以在校准对齐的同时,保护预训练阶段学到的模态专属表征不被冲毁。强化学习训练集只有1000个首帧-提示对,这个规模说明对齐阶段做的是“精准矫正”,而不是“大洗牌”——重头戏还是前面两阶段的预训练。

自回归1步2K精炼:高效提升分辨率而不破坏音视频同步

原生联合生成和2K精炼,听起来是在说同一件事,但两者的计算特性完全不同。联合生成阶段处理的是低分辨率潜空间,计算量可控;而2K精炼要恢复高频空间细节,必须处理更大的特征图,计算需求陡增。如果硬要同一个模型同一套参数扛住两种任务,结果往往是两头不讨好。
DreamX-Creator 1.0 的策略是:单独搞一个2K精炼器,而且要走一条“变快”的路——把双向多步教师变成自回归多步精炼器,再蒸馏成每段时间块只需一次去噪评估的1步学生。整个过程如图7所示。
图7:2K精炼器训练pipeline
图7:2K精炼器的训练pipeline。双向多步精炼教师被适配为自回归多步精炼器,再蒸馏为自回归1步2K学生,最终每个时间块只需一次去噪评估。
这里的蒸馏方法叫DMD蒸馏(Distribution Matching Distillation,分布匹配蒸馏),核心思想是让一个1步学生模型去匹配多步教师的输出分布,而不是逐像素对齐某一张图。这样学生学到的是教师“生成风格”的整体倾向,而不是死记硬背某个固定去噪路径。1步出图,速度提升自然可观。
为什么要把双向改成自回归?双向模型看完整段视频再精炼,理论上质量更好,但每帧都要反复迭代,推理开销大。自回归按时间块逐步精炼,每处理完一个块就能输出结果,配合1步蒸馏,把推理成本压到极低。关键还在于:精炼过程中音频流完全不动。也就是说,2K精炼只处理视频的空间细节,不碰音频,这样音画同步关系从生成阶段到精炼阶段都不会被破坏。
表5:精炼器对比
表5:基线生成器和多种视频修复/精炼方法的对比。箭头表示指标偏好方向。
表5展示了精炼器的实际效果。可以看到,1步蒸馏的精炼器在多项指标上逼近甚至追平多步教师,且推理代价大幅下降。这个“效率换质量”的取舍在工程上非常实用——毕竟2K视频如果每帧都要几十步去噪,用户等不起。

7B模型对战22B/33B大模型:开源音视频生成的"以小博大"之路

论文评估部分的底气,首先来自模型能力对比表。先看表1:在“可下载权重、原生联合生成、官方支持2K及以上输出路径”三个维度上,DreamX-Creator 1.0 是目前已披露总骨干参数最小的模型——7B,而LTX-2.3是22B、MOVA是32B/18B、MiniMax H3是33B、MAGI-2总参数甚至高达114B。
表1:主流视频生成模型能力对比
表1:当代主流视频生成模型的能力对比。DreamX-Creator 1.0是已披露总骨干参数中同时满足开源、原生A/V和本地2K路径三者要求的最小模型。
如果说表1比的是“定位”,那表3就是实打实的数值对比。论文与NAVA、UniAVGen、Ovi以及DaVinci-MagiHuman变体做了初步定量比较,指标按评测目标分组:视频质量、音频质量、同步、语义一致性等。结果表明,DreamX-Creator 1.0 在多数关键指标上位居前列。
表3:与开源模型的定量对比
表3:与NAVA、UniAVGen、Ovi及DaVinci-MagiHuman变体的初步定量比较。加粗和下划线分别代表最优和次优。
更让人提神的是表4——对手换成22B的LTX-2.3和33B的MiniMax-H3,DreamX-Creator 1.0 同样在多项指标上打平甚至反超。这不是说7B碾压30B,而是说明在数据和训练策略到位的前提下,参数量并不是音视频生成质量的唯一决定因素。
表4:与更大参数模型的定量对比
表4:与更大的开源LTX-2.3和MiniMax-H3系统的初步定量比较。
图8进一步给出用户盲测结果。上半部分是和Ovi、UniAVGen、NAVA、DaVinci的对比,下半部分是和Wan2.7、Kling v3、MiniMax-H3的对比。每个横向堆叠条代表DreamX-Creator 1.0视角下的胜/平/负百分比。在多个维度上,7B模型的人类偏好都明显占优。
图8:用户偏好盲测结果
图8:用户偏好研究。上半部分对比Ovi、UniAVGen、NAVA和DaVinci,下半部分对比Wan2.7、Kling v3和MiniMax-H3,盲测结果以DreamX-Creator 1.0视角统计胜/平/负百分比。
mmexport1760710364748.jpg
为什么7B能打出这种局面?回过头看整个系统,答案藏在四个环节里:数据系统保证了训练数据的质量和跨模态对齐度,门控交叉注意力让有限参数高效交换信息,渐进式训练保护了模态专属表征,模态感知强化学习精准对齐人类偏好,最后2K精炼拉高了最终观感。这一整套组合拳,比单纯堆参数吃力多了,也聪明多了。
当然,论文多处明确标注了preliminary,且从PaperDaily已收录的同领域对比来看,各家评测协议存在差异。7B在部分场景能不能稳定维持这种优势,还有待第三方复测和更大规模的真实场景验证。但至少,这条路证明了“小而精”在音视频生成里是可行的。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?阿里巴巴DreamX团队开源7B原生音视频联合生成系统,支持首帧+文本生成同步音视频,门控交叉注意力与强化学习加持,结合自回归1步2K精炼,性能对标22B/33B大模型。
这篇工作最值得看的点是什么?在Verse-Bench上,7B模型在视频质量、音频质量和音视频对齐方面达到与更大规模模型竞争的性能;在DeSync分数上表现最优(0.1351),视频质量VQ达到0.6573;2K精炼器在MUSIQ和MANIQA上取得最高分。
这篇工作的边界或风险在哪里?优点:1)紧凑的7B模型实现原生联合音视频生成,开源可复现;2)门控交叉模态注意力设计精巧,支持双向交互且可自适应调节交互强度;3)完整的数据系统、训练范式和精炼流水线;4)在多个指标上达到与更大模型竞争的性能。缺点:1)在音频美学和跨模态语义方面仍落后于LTX-2.3和MiniMax-H3等更大模型;2)音频后训练和跨模态对齐仍有提升空间;3)强化学习阶段训练集规模较小(仅1000对);4)部分设计(如RL和Refiner)在论文中标注为初步报告,验证要求明确但实证声明有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一个以7B参数生成器为核心的紧凑型原生联合音视频生成系统,通过门控跨模态注意力实现音视频流的双向交互,并采用渐进式联合训练、模态感知强化学习和自回归1步2K精炼流水线实现高质量同步生成。

实验合理度:★★★★☆

视频质量(VQ,包含Aesthetic Predictor、MUSIQ、MANIQA和DINOv3)、音频质量(AudioBox Aesthetics的CE、CU、PC、PQ四个维度)、语音生成(WER和LSE-C)、音视频对齐(Image。

学术研究价值:★★★★☆

提出一个以7B参数生成器为核心的紧凑型原生联合音视频生成系统,通过门控跨模态注意力实现音视频流的双向交互,并采用渐进式联合训练、模态感知强化学习和自回归1步2K精炼流水线实现高质量同步生成;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

7B参数生成器,训练使用相对适度的GPU-day预算;2K精炼器每个时间块仅需一次去噪评估。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1)在音频美学和跨模态语义方面仍落后于LTX-2.3和MiniMax-H3等更大模型;2)音频后训练和跨模态对齐仍有提升空间;


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球