MKB 神珍:科学数据不过「文本」这道关(SAIS 11B×六模态 / 接口税首次常参数定价 7/20 vs 17/20 / 冻结主干防遗忘 × ADMET 诚实边界)

先过素材海关。MKB = Monkey King Bang(神珍——金箍棒在东海龙宫的本名,一根铁如意变化万千),上海科学智能研究院(SAIS)团队,arXiv 2607.20557(2026-07-17),代码 Apache-2.0 开源。文案骨架全部属实:Qwen3-VL-8B 共享骨干 ✓、六分支(DNA/RN…

MKB 神珍:科学数据不过「文本」这道关

先过素材海关。MKB = Monkey King Bang(神珍——金箍棒在东海龙宫的本名,一根铁如意变化万千),上海科学智能研究院(SAIS)团队,arXiv 2607.20557(2026-07-17),代码 Apache-2.0 开源。文案骨架全部属实:Qwen3-VL-8B 共享骨干 ✓、六分支(DNA/RNA/蛋白质/小分子/地球系统/医学影像)✓、原生输入输出(分子字符串/气象场/分割掩码)✓、"转文本丢结构"的动机 ✓——论文原话:现有系统"要么专科,要么主要靠文本 token 化与提示接口统一科学数据,无法处理多样科学输入、产出模态原生输出"。文案没给的数字补上:总参数约 11B;Biology-Instructions 20 个任务 17/20 进前二,超过 Intern-S1-Pro(1T 参数,16/20);中期天气预报在评测设定下优于 ECMWF 业务系统 HRES(Pangu-Weather/GraphCast 同款基线);医学影像多模态总 Dice 最佳;科学训练后通用能力基本保留。两处校准:①GitHub 目前 37 star——机构打法、财经媒体稿先行,社区热度尚未起,与 Semantica 的病毒式 star 是两种画像;②论文是 7 月 17 日的,素材晚了六周,作为"新发布"转述需校准时间戳。

一、接口税:第一次有了对照实验

这篇报告里最值钱的不是 11B 打平 1T,是那个同规模对照组:ChatMultiOmics——Llama-3.1-8B 微调,把 DNA/RNA/蛋白质/分子序列直接当文本 token 表示,无模态编码器。同一张 Biology-Instructions 考卷:

ChatMultiOmics(8B,文本化)     7/20 进前二
MKB(8B 骨干+原生编码器)        17/20 进前二
Intern-S1-Pro(1T,文本化)      16/20 进前二

这是"接口丢结构"命题目前最干净的一次产业级测量:参数量恒定时,文本化接口 vs 原生编码器差出 10 个名次;万亿参数买不回 8B 原生接口丢掉的结构。Intern-S1-Pro 用 100 倍参数补文本接口的损耗,勉强追平——论文的措辞很准:"largest current scientific multimodal LLMs focus on textual scientific reasoning and do not natively emit continuous-field forecasts or high-resolution segmentation masks"。梯度上不去的结构,参数堆不回来。这给接口经济学补上了缺失的一环:此前证据(CLEVR 消融、Semantica 图原生 vs 向量 RAG)都说"结构在接口处丢失",MKB 给出了价格——这个税,一百倍参数只够补到及格。

二、冻结主干:遗忘问题的训练学解

MKB 的两阶段课程论文自称 "modality-then-language":Stage 1 冻结 Qwen3-VL 主干,只训各模态编码器/适配器/解码器;Stage 2 再用科学+通用混合语料做七模态联合巩固。两个效果,对应两条主线:

其一,通用能力保留。 科学数据训练最容易把骨干的通识冲掉(灾难性遗忘)。MKB 的解法是把模态组件做成隔离层——科学梯度只流向编码器,主干冻结期零污染;Stage 2 用混合语料温和巩固。这是 Mobius「知识-推理解耦=干净遗忘的架构前提」的训练学实现:解耦不发生在参数里,发生在梯度通路上。

其二,对 vision laziness 的第二种解法。 FAIR×Oxford 的多模态预训练物理说:语言 warm-up 越久视觉通路越躺平,解药是早期统一让捷径不存在。MKB 给出另一个答案:让捷径无法形成——主干冻结期间,语言通路不参与竞争(梯度不流),每个模态的表示学习先独立站稳,再进联合课堂。同一物理,两种工程:早统一 vs 先分立后统一。哪种更优没有结论,但"冻结强势通路"这个操作值得所有多模态训练工程师记下。

三、被低估的部分:数据纪律

论文把数据构造称为"一等公民",其中最硬的一条是 entity-level 切分与泄漏控制:蛋白按聚类、分子按骨架(scaffold)整体分配到单一 split——原话:"随机记录级切分会系统性高估生物数据上的性能,因为近重复序列和骨架会跨过切分边界"。生化 ML 圈大量漂亮数字死于这一条。这是 ARS/WRC 的验证纪律落在数据工程层的样子:不控制泄漏的 benchmark 分数不是证据,是幻觉。另外跨模态监督(酶催化 protein×molecule、RNA-蛋白互作)在网页语料里不存在,只能从 BindingDB 这类结构化库里构造——科学数据经济学与网页预训练根本不同:通用货币不是文本,是互作。

四、诚实边界:token 门前的精度死亡

论文自认的局限值得放大:"requiring precise scalar prediction 的任务表现仍不一致,尤其 ADMET 相关终点"。注意失败面的形状:原生结构输出(SMILES、气象场、分割掩码走各自的解码器)都好,偏偏是标量回归死在门口。这是"token 是贵的接口"的回归版——离散词表过投影窄门,结构可以分词存活,精度不能。多模态统一的失败表面精确映射接口经济学:结构走原通路,精度死在 token 门。和 SSP-BO 用 VSA 表示连续量的动机同源。报告没回避,加分。

五、主线回接

接口丢结构第十四验(科学基础模型版):十二验(CLEVR 预训练动力学)、十三验(Semantica 商业图谱基建)之后,MKB 补上科学计算域——且首次给出常参数对照定价。资源平权再添一子:11B 可训规模打出 1T 文本化的成绩,结构保留比参数规模更值钱。上海本地对局也有意思:SAIS(11B 原生路线)vs 上海 AI Lab Intern-S1-Pro(1T 文本路线)——同城两种哲学正面碰撞,MKB 用小两个数量级的模型先拿下考卷。

观察点:①37 star 的仓库六个月后是否有第三方复现与下游采用(机构发布的真实检验);②ADMET 标量短板会不会催生"标量头"这种新原生解码器——接口清单还缺一格;③ HRES 对比"on the evaluated settings"的限定词——中期预报的完整验证(极端事件、长时效)是气象圈的老考点。


信源:arXiv 2607.20557v1(SAIS Team,2026-07-17,HTML 全文精读,17/20、7/20、1T/16/20、HRES、Dice、ADMET 局限、冻结主干课程、entity-level 切分均核自原文);GitHub Shanghai-Academy-of-AI-For-Science/MKB(37 star,Apache-2.0,8-20 仍在推送);新浪财经/东财 2026-07-18 报道(110 亿参数、六类数据)。文案骨架忠实、零数字,数字全部由本文补齐并核对。转载请注明出处。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

用 11B 参数打平 1T 参数——但这个"打平"的真正含义,原帖没拆到底。

MKB(Monkey King Bang,"神珍"——金箍棒在东海龙宫的本名)由上海科学智能研究院(SAIS)2026-07-20 开源,论文 arXiv:2607.20557。原帖把核心架构(六模态:DNA/RNA/蛋白质/小分子/地球系统/医学影像;原生输出:分子字符串、气象场、分割掩码)和对照实验(Biology-Instructions 17/20 vs Intern-S1-Pro 1T 16/20 vs ChatMultiOmics 8B 7/20)都摆到了。但它漏了三件最硬的事实:

其一,"接口税"的产业级测量是这篇论文的真正新意。原帖说 MKB 8B 17/20 vs Intern-S1-Pro 1T 16/20 是为了证明"参数堆不够"。但对照组的关键不在参数,在于接口方式:

  • ChatMultiOmics(Llama-3.1-8B 微调)= 把 DNA/RNA/蛋白质/分子序列当文本 token 表示,无模态编码器
  • MKB(Qwen3-VL-8B 共享骨干)= 给每个模态原生编码器 + 适配器 + 解码器
  • Intern-S1-Pro(1T 参数)= 文本化接口 + 100 倍参数
同模型规模(都是 8B)下,文本化接口 vs 原生编码器差出 10 个名次。Intern-S1-Pro 用 100 倍参数补文本接口的损耗,勉强追平 8B 原生接口。这是"接口丢结构"命题目前最干净的一次产业级测量。原帖把它说成了"MKB 11B 打平 1T"——但真正硬的是它给出了"参数堆不回来结构"这个命题的价格。

其二,"冻结主干 + 模态先学"是训练学解。原帖说 MKB 用两阶段课程(Stage 1 冻结主干训模态组件,Stage 2 解冻用混合语料巩固)——但这条训练路径的真正含义是"用梯度通路做模块化"。Stage 1 期间,科学梯度只流向编码器,主干冻结期零污染;Stage 2 才让语言主干参与联合训练。

这件事和 Mobius(上海 AI Lab 的"知识-推理解耦"工作)形成对照——Mobius 把解耦做到参数层(不同模块负责不同能力),MKB 把解耦做到梯度层(不同阶段不同梯度流通路)。两种解耦都可以避免灾难性遗忘——MKB 给出了第二条路的实证。

其三,地球系统预报的隐含贡献。原帖说 MKB "中期天气预报在评测设定下优于 ECMWF 业务系统 HRES"——Pangu-Weather / GraphCast 同款基线。这意味着 MKB 是第一个用统一 Transformer 框架同时做"序列理解 + 场预报 + 分割生成"的开源模型。这件事的工程意义——天气预报和生物序列与医学影像过去是三个完全不同的模型栈,MKB 把它们压进同一个模型里,且精度都不掉。

但最该补的一条原帖没讲——GitHub star 数 = 37。这是个非常诚实的数字。这与 Semantica(开源版 Palantir,GitHub 11.3k star)、OpenMontage(13k)这种"病毒式开源项目"是两种画像——MKB 是机构打法、媒体稿先行、社区热度滞后。

为什么这事重要?因为 MKB 的真正使用者不是 GitHub 上 star 它的开发者——是星河启智科学智能开放平台上的 1500+ 科研模型用户。MKB 的开源姿态是"机构-机构"开放,不是"个人-社区"开放。原帖把这篇论文和 Semantica 的 star 数放在一起对比时,两种开源姿态的产业意义完全不同——前者是基础设施的公共化,后者是产品力的展示。

我得诚实说一句——原帖说"Biology-Instructions 17/20 进前二"——论文原话是 "MKB 8B reaches 17/20 top-two"。"进前二"是对比三款模型(MKB、Intern-S1-Pro、ChatMultiOmics)得出的位次,不是绝对意义上的"前二"。这件事的工程含义——MKB 8B 在三人局里压倒 Intern-S1-Pro 1T,是接口红利,不是绝对精度领先。

另一个原帖漏掉的硬细节——医学影像 Dice 91.20。这是九种影像模态(CT、MRI、病理等)、逾十万个图文样本评测出的结果,7 种参评方法里排第一,5 类影像排第一、4 类排第二。这件事单独拿出来是个完整工作——MKB 在医学影像上已经达到了接近 SOTA 的水平。这种跨模态的稳定精度才是"MKB 11B vs Intern-S1-Pro 1T"对比的核心证据——不是某个 benchmark 领先,是六个模态平均领先。

最有意思的工程后果:MKB 的两阶段课程给多模态训练工程师提供了一个"冻结强势通路"的操作范式——主干先冻着,每个模态自己站稳再联合。这件事与 FAIR×Oxford 多模态预训练"语言 warm-up 越久视觉越躺平"的发现形成对照——早统一 vs 先分立后统一,两条路都有效。MKB 的实证意义是当模态数量 > 3 时,"先分立后统一"比"早统一"更稳。

把这件事和 8-28 DeepMind Gemini Co-Scientist 接管 CVD 炉、8-29 RedEvoAgent 红队经验演化、8-27 Visual Retrieval Heads 机理 interpretability 放一起看——2026 年 8 月最后一周,AI 的几个独立分支同时给出了"从假设到实证"的完整链路。MKB 是其中唯一一个用机构化开源姿态把成果交给中国科研系统的工作。

最后一条:原帖说"MKB 是大圣(3 月发布的科研 Agent 大脑)的超级大脑"——这件事的真正含义——科学 Agent 在中国已经形成"基础模型 + Agent 框架 + 任务环境"三层栈。MKB 是底层,中间是大圣,顶层是星河启智平台上的 1500+ 工具。这三层栈一旦稳定下来,中国 AI for Science 的基础设施就完成了从"单点突破"到"工程化生产"的转变。

——MKB 的真正意义不是 11B 打平 1T,是它给中国 AI for Science 立了"模态原生 + 训练学解耦 + 机构开源"的三条标准。以后同方向的工作会引用这三条。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens