90% 是真的。但先把四把尺子摆在一起
八个 IDR 设计任务里,序列能点亮多少目标 SAE 特征:
| 序列来源 | 点亮比例 |
|---|---|
| RL-SAE 生成 | 90% |
| 激活引导 | 24% |
| 有监督微调 | 15% |
| 天然功能序列 | 21% |
| 随机挑 30 个特征再 RL | 55–68% |
idiom-db 也在。问题出在后两行。
先看第一行:天然序列自己只有 21%
真正在体内有功能的天然 IDR,只点亮这 30 个特征里的 21%。RL-SAE 干到 90%,是天然序列的 4.3 倍。
功能端的读数同样夸张:RL-SAE 序列的 PADDLE 转录激活分数是天然激活域的 209%,SUMO 化基序密度 5.63 对天然 0.60(9.4 倍)。
所以这 90% 的正确读法不是「设计得更像天然 IDR」,而是「更精确地命中了奖励函数」。它证明的是可控性,不是生物学合理性。
第二行:随机特征也能到 55–68%
附录 K 里他们给自己找了个对照——随便挑 30 个 SAE 特征做 RL:R_S 照样能跑到 0.55–0.68,比天然序列的 21% 还高一倍多,而 ProtGPS 功能分纹丝不动。
这说明 R_S 这一列单独读没有含义。它只有在配一组合适的特征时才与功能分正相关。既然随便挑都能刷到 0.6,那么 0.9 这个数字本身的信息量就要打折。
第三处,也是最要命的一处:零湿实验
论文自己在 Limitations 写死了:
> the evaluations in this paper are computational and experimental validation is needed to confirm whether the predicted properties translate into biological function.
所谓「改善亚细胞定位与转录活性」,四个评价器全是预测模型:ProtGPS(区室)、DeepLoc 2.1(核质定位)、PADDLE(转录激活)、Metapredict V3 / IUPred3(无序性),抑制域干脆是 ψKxE / NDSM 两条正则数出来的。
一次转染没有,一次流式没有,一次 reporter assay 没有。作者简介里挂着 Bintu(做转录效应域实测的实验室)和 Dunn(单分子),但这篇没用上实验平台。
还有一层套娃是作者自己承认的:
> Since the IDR sequences used for compartment association feature enrichment are extracted from the same full-length sequences used to train ProtGPS, there is circularity in using ProtGPS as a downstream evaluator.
主表六个区室的分数全建立在这个循环上。正交的 DeepLoc 结果进了附录,正文只报了一句「六个区室里最好或次好」,没给数。
而附录里,至少两个任务是负结果
- 核孔复合体(NPC):Base 0.50 → 天然 0.48 → SFT 0.48 → 引导 0.40 → RL-SAE 0.32。生成的「核孔定位序列」在正交预测器上比什么都不做还差。
- P-body:主表里 top-30 只有 0.05,低于 base 0.17 和天然 0.27。正文被迫承认 "for all compartments except P-bodies"。
- 顺带:把 ProtGPS 直接当奖励的 oracle 基线(附录 L),六个区室全部刷到 0.98–1.00。对照之下,同一台机器能被刷到满分这件事本身,就让所有接近 1 的分数贬值。
该肯定的部分,还是一点没少
- IDiom-DB 是 5400 万条,从 AFDB v4 的 2.14 亿条序列按 90% 同一性聚类、再用 pLDDT 三分法(>80 折叠 / <70 无序 / 70–80 间隙)切出来的。规模是真的,而且切中肯綮——现有蛋白语言模型在全长序列上训练,先验偏向折叠结构域,这个任务恰恰要反着来。
- 不是在背答案:无条件生成 10 万条、上下文条件 16.63 万条,与训练集的最大序列同一性分布峰值落在 50% 附近。
- 可组合性做出来了:把「染色体定位」和「转录激活域 / 抑制域」拼进同一条序列,Table 3 里灰格子标出预期该高的几列同时对上了。这一格是真正的卖点。
一句话
点亮三十盏灯,不等于房子亮了——何况拿随机三十盏也能亮二十盏。这篇给了一枚能拧的旋钮,但旋钮接的是预测器的读数。等哪天真做出活性数据来,那才是故事的下半段。