生成模型的输出不是文件,是近千万亿个分子
常规做法里,生成模型吐出一串序列,然后交给合成仪一条一条做。中间隔着一道墙:计算机能采样多少,和机器能合成多少,是两件事。
常规做法里,生成模型吐出一串序列,然后交给合成仪一条一条做。中间隔着一道墙:计算机能采样多少,和机器能合成多少,是两件事。
变分合成(variational synthesis)把采样挪进了合成过程。DNA 固相合成是一步一步接核苷酸,如果在同一步同时注入核苷酸混合物,每个正在延长的分子遇到什么核苷酸就成了随机事件,概率由混合物浓度决定。于是合成仪本身就是一个采样器:一个孔里跑一次,出来的就是一批服从某个分布的分子。
\(q_\theta(X)=\frac{1}{M}\sum_{m=1}^{M}\prod_{\ell=1}^{L}\theta^{m}_{\ell,X_\ell}\)
M 个孔各跑一次再等浓度混合,整体分布是上面这个混合模型,θ 就是每一步的混合物配比。样本总数等于合成产量,量级在万亿到千万亿。【直引:arXiv:2609.35083 §2】
2026 年 9 月 28 日,Alan N. Amin、Mattia G. Gollub、Andrei Slabodkin、Elizabeth B. Wood、Eli N. Weinstein 提交《Continuous Variational Synthesis》(arXiv:2609.35083),解决的是这类模型一直不好训的问题。
🧱 原来的坎:参数被卡在离散空间里
合成仪不是什么配比都能加。通常要求是有限目录里的混合物,最常见的是 15 种等权重核苷酸混合物(四种碱基的所有非空子集,\(2^4-1\))。参数一旦被限定在这个目录里,梯度就没法走了,之前的办法只能用 EM 这类离散优化,预训练和无监督微调基本无从谈起。
这篇的做法分两步。先在连续空间里把模型当"自由"的训:把 θ 参数化成 softmax(φ),φ 取实数,这样 θ 能落在单纯形上任意位置,Adam 可以直接推。训完之后再做后训练量化,把每个 θ 舍入到最接近的物理可实现配比。
量化用的距离度量取 KL(\(\theta\|\theta'\)),效果最好。如果合成仪支持额外加 K 个共享预置混合物,先优化这些预置混合物使总距离最小,再量化。蛋白质情形在氨基酸空间训练,需要把核苷酸混合物的约束翻译成氨基酸混合物的约束。【直引:论文 §3】
🧪 四个任务,两套目标
| 任务 | 长度 | 孔数 M | 先验 | 奖励 |
|---|---|---|---|---|
| CYP2C9 酶 | 434 氨基酸 | 16 | 无(用多序列比对数据) | 无奖励,forward KL |
| HLA-A*02:01 肽 | 9 氨基酸 | 32 | 均匀分布 | MHCflurry 2.0 呈递百分位 |
| TCRm 抗体 CDRH3 | 15 氨基酸 | 32 | 自回归 transformer | 7M 参数 encoder,预测 pHLA 结合计数 |
| EF1α 启动子 | 150 bp | 32 | 微调后的 MarinDNA | BPNet 类 CNN,Jurkat 与 HEK 的 ATAC 差 |
两条训练路径:forward KL 预训练做 mode-covering,把训练数据分布覆盖住;reverse KL 微调做 zero-avoiding,往高奖励区收。质量-多样性前沿靠扫超参数 α 走出来,目标倾斜分布是 \(\tilde p(x)\propto \pi(x)\exp(\alpha r(x))\)。
梯度方差用三招压:解析熵(前两项可解析求导,只有最后一项要 REINFORCE)、先验的 Rao-Blackwell 化、leave-one-out 控制变量。还有 split-merge 重采样防止某些孔陷在局部最优。消融显示这些主要带来轻微变化,主要优势来自连续松弛加量化这一套。【直引:论文 §3 与消融】
📈 严格占优的帕累托前沿
摘要的原话是 achieving a strictly dominating quality-diversity Pareto frontier。具体到任务:
- 酶(CYP2C9)。 旧的 EM 变分合成几乎每个样本都带内部终止密码子,只有 \(2\times10^{-6}\) 的样本干净。cVS 生成的序列用 ESMFold 预测,pTM 和 pLDDT 接近进化序列,与人类 CYP2C9 的结构 TM-score 大于 0.8。
- HLA 肽。 多样性阈值按每个位置概率低于 3% 的氨基酸剔除后统计唯一序列数。cVS 在高多样性区间的提升最明显,量化的代价不大。
- 抗体 CDRH3。 cVS 同时拿到更高的平均预测结合计数和更高的相对先验多样性,帕累托占优 EM VS 与 PGLD。去掉 forward KL 预训练或去掉 reverse KL 微调都会掉,即便固定总奖励评估次数结论不变。核化 2-Renyi 熵显示 cVS 的模式更宽,PGLD 是铺得开但模式窄。
- 调控 DNA。 设计区 150 bp,奖励是 Jurkat(T 细胞)与 HEK(脱靶)在 300 bp 窗口内的平均染色质可及性之差。cVS 学到结构化设计和成组排布的 motif,和 PGLD 的产物形态不同。
容量实验给了两条单调曲线:增加预置混合物数 K,或增加孔数 M,free cVS 的性能平滑提升,量化后的性能也随之改善。训 forward KL 模型在 A100/H100 上不到 5 分钟,reverse KL 里超过 99% 的时间花在先验模型和奖励模型上,不花在变分合成模型本身。
🧬 湿实验那一半:1.6 nM
只有调控 DNA 这一条走了体外。
| 环节 | 数字 |
|---|---|
| 合成产量 | 1.6 nM,即 \(9.6\times10^{14}\) 个分子 |
| 建库投入 | 250 ng DNA |
| 测序平台 | Illumina NextSeq 2000,2×150 bp |
| 全长读段 | 24,471,996(正文另述约 2800 万组装双端读段) |
结果是体外 cVS 库拿到小的 KSD-B,同时保持高奖励和高先验似然,换核的带宽扫描也稳。UMAP 上看,体外 cVS、in silico cVS、free cVS 三者贴得紧,量化效应可见但不大。全部指标上体外 cVS 显著优于 in silico PGLD。【直引:论文 §2.4 与图 5】
🧭 为什么值得盯
第一,它把"生成"和"制造"接上了,而且是在样本量上接上的。千万亿级不是抽样估计,是物理产出。任何依赖大库筛选的方向(抗体发现、启动子工程、定向进化)都吃这个量级。【判断】
第二,连续松弛加后训练量化是个可迁移的套路。凡是"参数必须落在硬件允许的集合里"的生成问题——从光子芯片的相移量化到可控实验设计的离散档位——都能套同一招:先在连续空间训,再按 KL 距离舍入。【推论】
第三,它暴露了旧方法的失败有多彻底。EM 变分合成在酶任务上只有百万分之二的样本不带内部终止密码子,这个数字说明离散优化在这个尺度上根本走不动。【直引】
第四,湿实验只做了一条却做得很实。1.6 nM 产量配 2400 万条读段和 KSD-B 检验,比很多号称端到端的论文多给了两个数量级的证据。【判断】
⚠️ 边界
预印本。四个任务里只有调控 DNA 做了体外,酶、肽、抗体都是 in silico,评价依赖 ESMFold、MHCflurry 和自训的结合预测器,这些预测模型本身的误差会传到奖励里。论文在 Limitations 里写明,全长 CYP 这类超出单条寡核苷酸长度的设计需要组装或酶促合成,会带来额外约束和错误,所以没作为已完成的体外案例。
K 无限增大并不渐近逼近 free cVS,因为不是所有氨基酸分布都能由每个密码子内核苷酸独立抽取得到,这是量化的硬上限。孔数 M 默认只有 16 或 32,属于低容量设定,更高容量的表现是从趋势外推的。\(2\times10^{-6}\) 这个数字是 EM VS 的失败率,不是 cVS 的。【判断】
参考
- Alan N. Amin, Mattia G. Gollub, Andrei Slabodkin, Elizabeth B. Wood, Eli N. Weinstein,《Continuous Variational Synthesis》,arXiv:2609.35083,2026-09-28
- 变分合成原始方法背景;PGLD 作为对照方法
- 模型与工具:ESMFold、MHCflurry 2.0、MarinDNA、BPNet
- 检验方法:KSD-B(Kernelized Stein Discrepancy for Biological Sequences)