静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-04 17:40

90% 是真的。但先把四把尺子摆在一起

八个 IDR 设计任务里,序列能点亮多少目标 SAE 特征:

序列来源点亮比例
RL-SAE 生成90%
激活引导24%
有监督微调15%
天然功能序列21%
随机挑 30 个特征再 RL55–68%
RL-SAE 赢是毫无疑问的,把第二名甩开近四倍。工程也扎实:代码在 github.com/rotskoff-group/idiom,Apache/MIT 开源,v1.0.0 随论文同一天发布,权重在 HuggingFace(20M / 85M / 300M 三档),数据 idiom-db 也在。

问题出在后两行。

先看第一行:天然序列自己只有 21%

真正在体内有功能的天然 IDR,只点亮这 30 个特征里的 21%。RL-SAE 干到 90%,是天然序列的 4.3 倍。

功能端的读数同样夸张:RL-SAE 序列的 PADDLE 转录激活分数是天然激活域的 209%,SUMO 化基序密度 5.63 对天然 0.60(9.4 倍)。

所以这 90% 的正确读法不是「设计得更像天然 IDR」,而是「更精确地命中了奖励函数」。它证明的是可控性,不是生物学合理性。

第二行:随机特征也能到 55–68%

附录 K 里他们给自己找了个对照——随便挑 30 个 SAE 特征做 RL:R_S 照样能跑到 0.55–0.68,比天然序列的 21% 还高一倍多,而 ProtGPS 功能分纹丝不动。

这说明 R_S 这一列单独读没有含义。它只有在配一组合适的特征时才与功能分正相关。既然随便挑都能刷到 0.6,那么 0.9 这个数字本身的信息量就要打折。

第三处,也是最要命的一处:零湿实验

论文自己在 Limitations 写死了:

> the evaluations in this paper are computational and experimental validation is needed to confirm whether the predicted properties translate into biological function.

所谓「改善亚细胞定位与转录活性」,四个评价器全是预测模型:ProtGPS(区室)、DeepLoc 2.1(核质定位)、PADDLE(转录激活)、Metapredict V3 / IUPred3(无序性),抑制域干脆是 ψKxE / NDSM 两条正则数出来的。

一次转染没有,一次流式没有,一次 reporter assay 没有。作者简介里挂着 Bintu(做转录效应域实测的实验室)和 Dunn(单分子),但这篇没用上实验平台。

还有一层套娃是作者自己承认的:

> Since the IDR sequences used for compartment association feature enrichment are extracted from the same full-length sequences used to train ProtGPS, there is circularity in using ProtGPS as a downstream evaluator.

主表六个区室的分数全建立在这个循环上。正交的 DeepLoc 结果进了附录,正文只报了一句「六个区室里最好或次好」,没给数。

而附录里,至少两个任务是负结果

  • 核孔复合体(NPC):Base 0.50 → 天然 0.48 → SFT 0.48 → 引导 0.40 → RL-SAE 0.32。生成的「核孔定位序列」在正交预测器上比什么都不做还差。
  • P-body:主表里 top-30 只有 0.05,低于 base 0.17 和天然 0.27。正文被迫承认 "for all compartments except P-bodies"。
  • 顺带:把 ProtGPS 直接当奖励的 oracle 基线(附录 L),六个区室全部刷到 0.98–1.00。对照之下,同一台机器能被刷到满分这件事本身,就让所有接近 1 的分数贬值。
另外误差棒不小:Speckle 是 0.36 ± 0.15,Stress granule private-30 是 0.51 ± 0.36。标准差和均值同一个量级,这时候「八个任务平均」这种聚合口径很脆。

该肯定的部分,还是一点没少

  • IDiom-DB 是 5400 万条,从 AFDB v4 的 2.14 亿条序列按 90% 同一性聚类、再用 pLDDT 三分法(>80 折叠 / <70 无序 / 70–80 间隙)切出来的。规模是真的,而且切中肯綮——现有蛋白语言模型在全长序列上训练,先验偏向折叠结构域,这个任务恰恰要反着来。
  • 不是在背答案:无条件生成 10 万条、上下文条件 16.63 万条,与训练集的最大序列同一性分布峰值落在 50% 附近。
  • 可组合性做出来了:把「染色体定位」和「转录激活域 / 抑制域」拼进同一条序列,Table 3 里灰格子标出预期该高的几列同时对上了。这一格是真正的卖点。

一句话

点亮三十盏灯,不等于房子亮了——何况拿随机三十盏也能亮二十盏。这篇给了一枚能拧的旋钮,但旋钮接的是预测器的读数。等哪天真做出活性数据来,那才是故事的下半段。

RL-SAE 点亮 SAE 特征:90% 对天然序列的 21%

暂无表态