论文标题:
SinAE: A Single-Architecture Flow-Matching Autoencoder for Cross-Domain Atomic Systems
发表日期:
2026年07月
发表单位:
National University of Singapore;Tencent AI for Life Science Lab
原文链接:
https://arxiv.org/pdf/2607.12380v1.pdf
开源代码链接:
https://anonymous.4open.science/r/SinAE_anonymous-523D/
用一套Transformer吃定分子、晶体和蛋白质?SinAE做到了!
这篇工作的狠劲,不在于又堆了多少花哨模块,而在于它做了一件很“反工程直觉”的事:把分子、晶体、蛋白质这三类原本各玩各的 3D 生成任务,塞进同一套 vanilla Transformer 里,还真跑通了。更离谱的是,它不是靠一个脆弱的“勉强能看”的 demo,而是把重建误差压到接近零,再让同一个潜空间接上标准 DiT 先验做生成,结果还挺能打。图1:SinAE 总览。它把分子、晶体和蛋白质统一成一套流匹配自编码器,周期性系统额外用 3 个晶格 token 表示晶格向量;同一潜空间再接一个 DiT 先验,就能做从零生成。如果把传统路线比作“每个领域请一位专科医生”,那 SinAE 更像是请了一位全科医生,还顺手把手术刀换成了统一接口。它的核心不是让编码器学会所有几何细节,而是把最难的重建压力交给解码器,用迭代式流匹配解码去一点点把结构“雕”回来。这样一来,编码器可以保持简单、通用,潜空间也更容易被后续先验模型接住。
设计理念:放弃领域特化,统一框架下的流匹配自解码
先把话说人话:这篇论文真正想解决的,不是“再做一个更强的生成模型”,而是“能不能别给每个 3D 领域单独写一套架构、再单独调一堆损失函数”。因为分子要管键长键角,晶体要管周期性和晶格不变性,蛋白质还要管残基骨架和序列协同,工程复杂度一上来就很容易变成“模型还没训好,loss 已经先吵起来了”。SinAE 的思路是反着来:编码器只负责把结构压成紧凑潜变量,真正的几何复原交给流匹配解码器。也就是说,编码器不用硬背下每一个原子坐标的细枝末节,只要把信息压缩得足够好;解码器则像一个“慢工出细活”的修复工匠,通过多步迭代把噪声结构逐步拉回真实结构。图2:SinAE 架构与流程。左侧是共享嵌入、Transformer 编码器、流匹配解码器和潜空间 DiT 先验;右侧展示了重建训练、先验训练和生成过程。这里有个关键点值得单独拎出来:它没有用图网络、没有用等变层、没有用晶体专属模块。所有输入都先被当成 token,再交给 vanilla Transformer 处理。为了不让这个“非等变”的骨架被方向信息带偏,训练时再加随机 SO(3) 旋转和必要的平移增强。说白了,就是不给模型偷懒抄方向答案的机会。它的输入构造也挺干净。原子类型用可学习嵌入,坐标直接线性投影;蛋白质里每个残基按 Cα 位置表示;晶体则额外把三个晶格向量当成三个虚拟 token 接到序列末尾。这样做的好处很朴素:同一套序列接口,吃下不同几何对象,不用为了每种数据再改一遍网络骨架。