内容提要
稳准智能与清华崔鹏团队发布数据大模型LimiX-2,参数升至400M,在TabArena、BCCO、TALENT三大结构化数据榜单均列第一,超越Google、SAP等。模型沿上下文机制网络、合成数据引擎、Scaling三条路线升级,从目标预测转向结构发现,在因果发现数据集上领先传统方法,已覆盖3800余场景并与60多客户合作。
延伸解读
从预测到结构发现:建模目标的转变
LimiX-2提出的上下文机制网络(CMNs)将建模重点从指定目标变量的预测分布,转向变量之间的联合依赖关系。传统PFNs以目标预测为核心,而CMNs关注变量如何相互关联、构成内在结构。这一转变使分类、回归、缺失值填补等任务被统一为对同一数据模型的不同查询,并为结合因果假设进行因果骨架发现提供了统计基础。
合成数据引擎:应对结构化数据稀缺
结构化数据多存于企业内部系统,难以像互联网文本一样大规模公开获取。LimiX-2升级了自动化合成数据生成引擎,可生成线性、非线性、多变量交互、周期变化和噪声扰动等不同分布的数据。这让模型在进入真实企业前就能接触更多数据结构和变量关系,与TabPFN、Mitra等表格基础模型普遍使用合成数据预训练的做法一致。
参数扩至400M:Scaling路线的持续验证
继去年11月提出结构化数据基础模型遵循Scaling Law后,LimiX-2将参数规模提升至400M。这一扩展旨在让所选技术路线在更大规模和尺度上得到验证,以获得更强的泛化能力,并进一步发挥因果关系规律挖掘和稳定表达的优势。参数提升是模型能力升级的三条技术路线之一,与上下文机制网络和合成数据引擎升级并列。
因果发现突破与真实场景验证
除榜单体现的分类、回归等预测能力外,LimiX-2在因果发现方面也展现出技术突破。传统因果发现方法依赖专家先验或严格统计假设,难以应对高维企业数据,而LimiX-2在Sachs、UF、Causal Chamber等公开标准数据集上显著领先传统方法。截至2026年世界人工智能大会,上一代LimiX已完成3800余个结构化数据场景的通用性验证,并与60多个客户达成战略合作,覆盖工艺参数优化、设备故障预测、电力预测、能耗优化和材料科学等方向。
Q&A
LimiX-2是什么?由谁发布的?
LimiX-2是稳准智能联合清华大学计算机系崔鹏教授团队于2025年9月16日发布的新一代数据大模型,参数规模提升至400M。
LimiX-2在哪些国际评测榜单上排名第一?
LimiX-2在TabArena、BCCO、TALENT三个国际主流结构化数据Benchmark中总体Elo分数分别达到1935、1432和1506,均位列第一,超过Google、SAP、Amazon等国际大厂的同类模型。
LimiX-2相比上一代有哪些技术升级?
主要沿三条技术路线升级:一是上下文机制网络CMNs,将建模重点从目标变量转向变量间关联;二是升级预训练阶段的自动化合成数据生成引擎;三是进一步Scaling,将参数规模扩大至400M。
LimiX-2在因果发现方面有什么突破?
LimiX-2在Sachs、UF、Causal Chamber等多个因果发现公开标准数据集上显著领先传统因果发现方法,传统方法依赖专家先验或严格统计假设,难以应对高维企业数据。
LimiX-2目前有哪些应用场景和合作客户?
截至2026年世界人工智能大会,上一代LimiX已完成3800余个结构化数据场景的通用性验证,并与60多个客户达成战略合作。典型应用方向包括工艺参数优化、设备故障预测、电力预测、能耗优化和材料科学。
LimiX-2的技术报告和代码在哪里可以获取?
技术报告标题为《LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence》,地址为https://arxiv.org/abs/2609.17488;GitHub地址为https://github.com/limix-ldm-ai/LimiX;Huggingface地址为https://huggingface.co/stable-ai/LimiX-2;ModelScope地址为https://modelscope.cn/models/stable-ai/LimiX-2。