[论文] LimiX-2: A Contextual Mechanism Network Towards General Structured-Dat...

研究领域: ML 作者: Xingxuan Zhang, Gang Ren, Hao Yuan, Hao Zou, Hongze Tan, Hui Wang, Jianhao Song, Jiansheng Li, Jiayao Zhang, Jinghan Zhang, Kaifang Li, Lang Mo, L…

论文概要

研究领域: ML 作者: Xingxuan Zhang, Gang Ren, Hao Yuan, Hao Zou, Hongze Tan, Hui Wang, Jianhao Song, Jiansheng Li, Jiayao Zhang, Jinghan Zhang, Kaifang Li, Lang Mo, Li Mao, Mingchao Hao, Nuo Xu, Rui Ding, Ruiji Zhang, Shuyang Li, Siyu Mei, Tianyang Zhang, Weiyang Mu, Yancheng Dong, Yongxian Wei, Yuan Xue, Yuanrui Wang, Yue He, Zijia Yang, Ziyun Li, Dongzhe Li, Fuqiang Wang, Jiandong Liu, Jiawei Chen, Jiaxin Du, Kaijie Cheng, Kehan Li, Lei Sun, Linjun Zhou, Ningbo Dai, Qi Wang, Renzhe Xu, Shaoxing Du, Shumeng Yang, Wang Lu, Wenjing Chu, Xiannan Huang, Xiaoyu Lin, Xing Ai, Xinyan Han, Xuanyue Li, Xuanyue Su, Xukun Zhang, Yan Lu, Yaxin Zhang, Yi Qin, Yifei Huang, Yihan Xu, Yongle Lv, Yuanyuan Jiang, Yushan Han, Peng Cui 发布时间: 2026-09-15 arXiv: 2609.17488

中文摘要

我们推出 LimiX-2——LimiX 家族的新模型,通过由我们先前建立的缩放定律指导的模型和数据缩放开发而成。LimiX-2 采用情境机制网络(CMNs)范式,使用情境条件掩蔽建模(CCMM)进行预训练。CMNs 将上下文学习的组织原则从以目标为中心的预测转变为面向机制的联合建模。网络不再围绕传统表格PFN的 p(y|x, D_context) 目标,而是围绕学习 p(x, y| D_context) 设计——这是对数据生成底层结构的上下文依赖表示。预训练使用由结构因果模型(SCM)生成的合成数据集,涵盖多样的图结构、功能机制和观测过程。在 TabArena、TALENT 和 BCCO 上的评估表明,LimiX-2 优于当前特定数据集的模型和表格基础模型。除预测性能外,CMN 范式还促进了 LimiX-2 的因果感知能力:其特征注意力编码了直接的因果关系,能够实现准确的因果骨架恢复。

原文摘要

We introduce LimiX-2, a new model in the LimiX family, developed through model and data scaling guided by our previously established scaling laws. LimiX-2 adopts the Contextual Mechanism Networks (CMNs) paradigm and is pretrained with Context-Conditional Masked Modeling (CCMM). CMNs shifts the organizing principle of in-context learning from target-centric prediction to mechanism-oriented joint modeling. Rather than centering the network on the \(p(y \mid x, D_{\mathrm{context}})\) objective of conventional tabular PFNs, it is designed around learning \(p(x, y \mid D_{\mathrm{context}})\), a context-dependent representation of the joint structure underlying data generation. Pretraining uses synthetic datasets generated by structural causal models (SCMs) spanning diverse graph structures, funct...


*自动采集于 2026-09-17*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

拿到一张体检单,你最先看的不是每一项的数值,是那些箭头——向上还是向下、偏了多少。

但还有个更值钱的问题:这张单子上,哪一项在影响哪一项

LimiX-2 想干的,就是把这第二个问题也做进去。

一、有一条硬信息,直接决定你能不能上手

帖子转述的是摘要,漏了发布侧的实况:LimiX-2 是 400M 参数,2026 年 9 月 16 日随仓库开源,权重与推理代码一起放出来。一个预训练模型,一次前向同时做分类、回归、缺失值填补,不需要任务特定参数更新。

【直引】但许可证换了:Usage is subject to StableAI LimiX Non-Commercial License。上一代 LimiX-16M(2025 年 8 月 29 日)是 Apache 2.0。

【判断】这条比任何 benchmark 数字都影响选型。能不能商用是第一个问题,不是最后一个。

二、TabArena 上的差距不是"略优"

帖子只说"优于现有的数据集特定模型和表格基础模型"。仓库给的是:TabArena 全榜四项预测指标第一,Elo 1935,比第二名 TabFM+ 高 117.4 点,平均排名 5.5,聚合胜场 18.9(约 TabFM+ 的 3.6 倍)。

【推论】117.4 点 Elo 差在这个赛道上不小。表格基础模型过去一年的头部差距通常在几十点以内。

三、"因果骨架"这一条要加限定

帖子把"特征注意力编码了直接的因果关系,能准确恢复因果骨架"当成并列卖点。这话有个前提帖里没写:预训练数据是结构因果模型生成的合成数据,覆盖多样的图结构、功能机制与观测过程。

【推论】模型是在"因果结构已知、并当作生成过程写进去"的数据上学出来的。这不等于它能在真实观测数据上恢复真实因果。

论文自己的措辞是 "promotes causal awareness",不是 "enables causal discovery from observational data"。

【判断】这条值得单独追,因为它是分水岭:只是把 SCM 的分布学进去,那它是个很好的结构先验;能在没见过的真实数据上标出正确的边,那是另一件事。

四、回归头换了算法,帖里没写

LimiX 用 MSE。LimiX-2 换成了:把目标区间切成 5000 个有序箱,预测每个箱的概率,再用箱中心加权求和得回归值。网络 24 层。

【推论】这个改动和"机制导向的联合建模"是一套的。它不想只学点到点的映射,它想学条件分布的形状。

下一根钉子

CMN 的口号是把 p(y | x, D_context) 换成 p(x, y | D_context)。这个升级能不能被证伪,取决于一件事:在特征强共线性的表上,它是否比 TabPFN 这类先验拟合网络更稳。

这类数据集很好找(金融因子表、传感器阵列)。

如果有人贴出"共线性越高,LimiX-2 的相对优势越大"的曲线,那句口号就从修辞变成了机制。如果曲线是平的,它只是一次目标函数的改写。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens