← 返回 PaperDaily 大模型与智能体

NUS与腾讯提出SinAE:三域统一生成,结果还挺能打

一套 Transformer 同时吃下分子、晶体和蛋白,这类工作最值钱的地方不是“把模型做大”,而是把工程复杂度砍掉。SinAE 直接把重建压力交给流匹配解码器,结果是跨域还能做到近乎零误差,生成也没塌。

NUS与腾讯提出SinAE:三域统一生成,结果还挺能打
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
一套 Transformer 同时吃下分子、晶体和蛋白,这类工作最值钱的地方不是“把模型做大”,而是把工程复杂度砍掉。SinAE 直接把重建压力交给流匹配解码器,结果是跨域还能做到近乎零误差,生成也没塌。


原论文信息如下:
论文标题:
SinAE: A Single-Architecture Flow-Matching Autoencoder for Cross-Domain Atomic Systems
发表日期:
2026年07月
发表单位:
National University of Singapore;Tencent AI for Life Science Lab
原文链接:
https://arxiv.org/pdf/2607.12380v1.pdf
开源代码链接:
https://anonymous.4open.science/r/SinAE_anonymous-523D/

用一套Transformer吃定分子、晶体和蛋白质?SinAE做到了!

这篇工作的狠劲,不在于又堆了多少花哨模块,而在于它做了一件很“反工程直觉”的事:把分子、晶体、蛋白质这三类原本各玩各的 3D 生成任务,塞进同一套 vanilla Transformer 里,还真跑通了。更离谱的是,它不是靠一个脆弱的“勉强能看”的 demo,而是把重建误差压到接近零,再让同一个潜空间接上标准 DiT 先验做生成,结果还挺能打。
Figure 1
图1:SinAE 总览。它把分子、晶体和蛋白质统一成一套流匹配自编码器,周期性系统额外用 3 个晶格 token 表示晶格向量;同一潜空间再接一个 DiT 先验,就能做从零生成。
如果把传统路线比作“每个领域请一位专科医生”,那 SinAE 更像是请了一位全科医生,还顺手把手术刀换成了统一接口。它的核心不是让编码器学会所有几何细节,而是把最难的重建压力交给解码器,用迭代式流匹配解码去一点点把结构“雕”回来。这样一来,编码器可以保持简单、通用,潜空间也更容易被后续先验模型接住。

设计理念:放弃领域特化,统一框架下的流匹配自解码

先把话说人话:这篇论文真正想解决的,不是“再做一个更强的生成模型”,而是“能不能别给每个 3D 领域单独写一套架构、再单独调一堆损失函数”。因为分子要管键长键角,晶体要管周期性和晶格不变性,蛋白质还要管残基骨架和序列协同,工程复杂度一上来就很容易变成“模型还没训好,loss 已经先吵起来了”。
SinAE 的思路是反着来:编码器只负责把结构压成紧凑潜变量,真正的几何复原交给流匹配解码器。也就是说,编码器不用硬背下每一个原子坐标的细枝末节,只要把信息压缩得足够好;解码器则像一个“慢工出细活”的修复工匠,通过多步迭代把噪声结构逐步拉回真实结构。
Figure 2
图2:SinAE 架构与流程。左侧是共享嵌入、Transformer 编码器、流匹配解码器和潜空间 DiT 先验;右侧展示了重建训练、先验训练和生成过程。
这里有个关键点值得单独拎出来:它没有用图网络、没有用等变层、没有用晶体专属模块。所有输入都先被当成 token,再交给 vanilla Transformer 处理。为了不让这个“非等变”的骨架被方向信息带偏,训练时再加随机 SO(3) 旋转和必要的平移增强。说白了,就是不给模型偷懒抄方向答案的机会。
它的输入构造也挺干净。原子类型用可学习嵌入,坐标直接线性投影;蛋白质里每个残基按 Cα 位置表示;晶体则额外把三个晶格向量当成三个虚拟 token 接到序列末尾。这样做的好处很朴素:同一套序列接口,吃下不同几何对象,不用为了每种数据再改一遍网络骨架。

告别复杂损失函数:流匹配解码器的精妙之处

SinAE 最值得看的地方,不是“用了 Transformer”,而是它把重建任务改写成了流匹配问题。这里的流匹配(flow matching)可以简单理解成:不要求模型一口气猜对最终答案,而是让它学会“从噪声往真实结构移动时,每一步该往哪儿走”。这就像修图软件里的逐步修复,而不是一次性把整张图从马赛克里变出来。
论文里给出的解码器输入构造公式很直接:
公式1
式子里,WxWA 分别把坐标和原子类型映射到模型维度;eime(t) 是时间嵌入,告诉模型当前处于第几步;eipos 是位置嵌入。它的意思很朴素:模型每一步都知道“现在噪声走到哪了、我在序列中的哪个位置、当前 token 是什么”。
训练目标也被压成了一个统一的三项和:
公式2
其中 Lcoord 负责坐标的连续流匹配,Latom 负责原子类型的离散流匹配,LKL 则把潜变量往标准高斯上轻轻推一把。这里最妙的是:新增一个领域,不需要再设计一堆新损失,只要把数据喂进去。这对工程落地太友好了,少了很多“今天调坐标权重,明天调键型权重,后天调 violation loss”的玄学操作。
论文还给出了三项损失的权重设置:
公式3
可以看出,坐标损失权重最高,原子类型次之,KL 正则很轻。这个配比也合理:对 3D 原子系统来说,坐标错一点点,物理意义可能就差很多;而原子类型和潜空间分布则更多是辅助约束。
解码器还有一个很值得品的设计:它不是只在一步里输出最终结构,而是通过 ODE 轨迹逐步修正。论文里专门画了轨迹图,显示结构在前期主要完成几何定位,后期主要做局部精修。换句话说,先把骨架摆对,再慢慢抠细节,这比让一个单步解码器硬扛全局误差要靠谱得多。
Figure 5
图5:解码器 ODE 轨迹。左图显示沿生成轨迹的物理能量下降,右图显示相对最终状态的 RMSD 在较早阶段就趋于平台,说明前几步负责几何定位,后几步负责局部精修。
这也解释了为什么它能把重建误差压得这么低。论文里还专门画了“重建质量 vs 解码步数”的曲线,结果很诚实:从 1 步到 4 步掉得最快,到 6 步左右基本收敛。也就是说,这个解码器不是越跑越玄学,而是少量步数就能把关键几何修回来
Figure 6
图6:重建精度随解码函数评估次数变化。QM9 和 MP-20 的曲线都在前几步快速下降,并在约 6 步左右趋于稳定。

性能炸裂:亚毫埃级重建与SOTA生成

先看重建,再看生成,这是很重要的顺序。因为 latent 生成模型最怕的不是“先验不够强”,而是“编码器和解码器先把结构压坏了”。一旦重建本身有洞,后面的生成再强也只是把洞画得更像洞。SinAE 的强势之处就在于:它先把重建做到近乎无损,再谈生成
Figure 3
图3:跨领域重建 RMSD 的对数尺度对比。可以直观看到,SinAE 在晶体和蛋白质上把误差压到了比前一代基线更低的量级。
*表格超出部分左右可以滑动
方法能力结论
统一架构一套 vanilla Transformer 同时覆盖分子、晶体、蛋白质
重建精度分子和晶体达到亚毫埃级,蛋白质达到约 0.01Å 量级
生成方式同一潜空间接标准 DiT 先验,直接做从零生成
工程复杂度不需要图网络、等变层或领域专属模块
更具体地说,分子数据上,SinAE 在 QM9 和 GEOM-Drugs 上都达到了 100% 的结构匹配率,RMSD 也压到了极低水平。晶体数据上,MP-20 的重建同样是 100% 匹配率,且联合训练后还能继续下降。这个结果说明一个很现实的事情:跨域训练不是“平均一下就完事”,而是真的能互相提供几何先验
Table 1
表1:SinAE 与已有 latent autoencoder 基线的能力对比。这里最关键的不是“谁多了一个勾”,而是 SinAE 同时满足了三件事:覆盖三类领域、骨架还是 vanilla Transformer、重建还能做到 sub-mA 级别。
生成部分也没有掉链子。分子生成上,SinAE 的 PoseBusters Valid 指标很强,说明它不仅“看起来像分子”,而且真的经得起几何检查。晶体生成上,S.U.N. 和 M.S.U.N. 这类更苛刻的指标也拿到了领先结果。蛋白质生成上,设计性和多样性之间的老矛盾,被它拉到了一个相对更舒服的位置:既能生成可设计骨架,也能保持一定多样性。
Figure 4
图4:SinAE 生成样例。左边是小分子,中间是晶体,右边是蛋白质骨架。一个模型,三种对象,居然都能生成出像样的结果。
Table 4-5
表4-5:分子生成结果。QM9 和 GEOM-Drugs 上,SinAE 在有效性、唯一性、多样性以及 PoseBusters 约束下的几何质量上都保持了很强竞争力。
Table 6
表6:MP-20 材料生成结果。SinAE 在稳定性筛选后的硬指标上表现突出,说明它生成的不只是“结构合法”,而是更接近可用材料的候选。
Table 7
表7:蛋白质无条件生成结果。SinAE 在设计性和多样性之间做到了比较均衡的折中,不是单纯追求“好设计但太单一”,也不是“很花但基本不能用”。

不止拼精度:跨域联合训练带来正迁移

这部分是整篇里最容易被低估、但其实最有价值的地方。很多跨域模型嘴上说“共享表示”,结果一联合训练就互相拖后腿,像三个人挤一辆小电驴。SinAE 这次给出的证据却相当清楚:QM9 和 MP-20 联合训练后,两个域的重建都变好了,不是一个涨一个跌,而是双赢。
Figure 7
图7:SinAE 潜空间的 t-SNE 可视化。QM9 和 MP-20 在没有显式域标签干预的情况下自然分开,说明共享潜空间既能保留共性,也没有把不同领域糊成一锅粥。
这件事为什么成立?原因其实不神秘。分子和晶体虽然领域不同,但底层都是“原子在三维空间中的排布”,都要面对局部几何、邻近约束、原子间距离分布这些共性。SinAE 的 per-token latent 保留了每个位置的局部信息,不像全局瓶颈那样把细节一刀切掉,所以跨域时不会把所有结构压成一个模糊大团子。
Figure 8
图8:跨域潜空间插值。沿着两端 latent 做直线插值后,解码出来的结构会平滑变化,说明这个潜空间不是乱飘的,而是有连续几何语义的。
对工程侧来说,这个结果很有启发:跨域训练不一定意味着要做更复杂的多任务头,也不一定要引入一堆 domain adapter。只要潜空间设计得足够稳,解码器足够会“修”,不同领域的数据反而可能彼此补课。说白了,共享表示不是口号,关键是别把共享做成共享灾难

实验与展望:未来可及的点与线

从实验设计看,这篇论文的思路是比较扎实的:先统一重建框架,再统一先验生成,最后拿分子、晶体、蛋白质三类任务一起验证。它没有只挑一个“最容易出彩”的 benchmark,而是把不同粒度、不同约束强度的任务都摆出来,这样结论就更有说服力。
Figure 9
图9:蛋白质长度泛化。重建和生成在不同长度区间里都保持了相对稳定的表现,说明模型不是只会背短链样本。
不过,这篇工作也不是没有边界。首先,蛋白质部分目前只做到训练时长度上限附近的链长,长链要想继续扩展,估计还得重新设计长度预算。其次,虽然它把领域特化模块砍掉了,但这也意味着一旦遇到更强的领域约束,比如更复杂的晶体对称性或更长蛋白链,是否还能保持同样的精度,还需要更多验证。最后,代码虽然开放了,但整体复现仍然离不开较强算力和较细的训练设置,门槛不算低。
Figure 10
图10:QM9 和 GEOM-Drugs 的生成样例。样本看起来不只是“像个结构”,而是有较强的几何一致性。
Figure 11
图11:MP-20 生成样例。晶体结构不仅要“长得对”,还要尽量稳定,这也是材料生成最难的地方之一。
Figure 12
图12:AFDB-FS 蛋白质生成样例。骨架连贯性和局部几何都比较完整,说明同一架构对蛋白也能成立。
如果把这项工作放到行业里看,它的价值不在于“某个指标又高了 0.1”,而在于它给出了一个更可复用的方向:原子系统生成可以从领域专属架构,走向统一的 latent 生成范式。这对于药物发现、材料设计、蛋白工程都很有吸引力,因为训练数据往往稀缺,能共享的结构先验越多,模型越有机会跨域受益。
当然,真正落地时还得继续盯住三件事:一是更长序列和更大体系的扩展能力,二是更低成本的训练与推理,三是与真实下游任务的结合,比如筛选、优化和闭环设计。论文已经把“统一架构能工作”这件事证明了,下一步就看它能不能把“统一架构能省钱、能扩展、能上生产”也一起证明出来。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是“分子、晶体、蛋白质三类原子系统能不能用同一套生成框架”的问题。答案是可以,而且不是勉强拼起来,而是靠统一的 Transformer 编码器、流匹配解码器和潜空间 DiT 先验一起完成。

RMSD 是什么意思?为什么这里这么重要?RMSD 是均方根偏差,用来衡量重建结构和真实结构之间的几何距离。对原子系统来说,RMSD 不是普通“差一点”,而是可能直接影响键长、角度和物理稳定性的硬指标。

流匹配解码器和普通一次性解码器有什么区别?普通解码器更像“一步到位猜答案”,流匹配解码器则是“多步修正”。前者容易把复杂几何一次性压坏,后者则能先定位大结构,再逐步修局部细节,所以在精度上更稳。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把三类原子系统统一到同一套 vanilla Transformer + flow matching 框架里,这个思路很干净,也很少见;真正的创新点不在“又发明一个模块”,而在“把架构复杂度砍掉”。

实验合理度:★★★★☆。重建、生成、跨域迁移三条线都测了,而且对比对象覆盖了 latent 路线和直接生成路线,结论比较完整;不过部分设置仍依赖较强的训练细节,复现实验时要认真对齐。

学术研究价值:★★★★★。它证明了跨域原子系统可以共享潜空间,并且共享不是摆设,这对后续统一建模很有启发。

稳定性:★★★★☆。重建很稳,生成也有不错表现;但蛋白长链扩展和更复杂体系的稳健性,还需要进一步验证。

适应性以及泛化能力:★★★★☆。覆盖分子、晶体、蛋白三大类任务,泛化面已经很广;但再往更长序列、更强对称约束走,边界还没完全摸透。

硬件需求及成本:★★★☆☆。训练要单卡 H200 级别的算力,说明它不是“轻量玩具”;好在推理端因为没有复杂等变模块,理论上比很多专门架构更清爽。

复现难度:★★★☆☆。代码开放是加分项,但训练细节、数据处理和多域对齐都不算简单,想复现到论文数值不一定轻松。

产品化成熟度:★★★☆☆。适合做研究原型和中上游设计工具,但离稳定工业级闭环还差更全面的鲁棒性验证。

可能的问题:统一架构很漂亮,但长链蛋白、复杂晶体对称性和更大体系的扩展性仍待验证;另外,算力门槛不低,离“人人可训”还有距离。


主要参考文献

SinAE: A Single-Architecture Flow-Matching Autoencoder for Cross-Domain Atomic Systems. arXiv:2607.12380v1, 2026.
原文链接:https://arxiv.org/pdf/2607.12380v1.pdf
开源代码:https://anonymous.4open.science/r/SinAE_anonymous-523D/

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
分子、材料、蛋白一路读到黑,群里一起拆 SinAE 这类硬核新作,少走弯路,多看门道。🐉
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。