AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢

AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢

💡 原文中文,约5700字,阅读约需14分钟。
📝

内容提要

稳准智能联合清华发布400M参数结构化数据基础模型LimiX-2,在TabArena等三大国际基准的分类与回归任务中均排名第一,超越谷歌TabFM。其核心创新为上下文机制网络CMNs,将建模目标从目标预测转向变量关系与因果机制学习,代表LDM路线正成为AGI下一阶段的重要方向。

🔎

延伸解读

LDM与LLM:互补而非替代

文章指出,LLM主要处理已语义化的文本、代码等数据,而LDM直接面向工业生产中的高维结构化数据,如温度、压力等变量。这类数据往往未被人类总结成规则,且变量间的细粒度关系对预测精度至关重要。因此,LDM并非要取代LLM,而是补足LLM对真实世界理解不足的缺口,两者更接近平行、互补的基础模型路线。

技术范式差异:从预测到关系建模

以TabPFN为代表的PFN路线以目标变量Y为中心,擅长快速适配新表并预测Y。但LimiX-2提出的CMNs将建模目标转向全变量联合依赖和数据生成机制,直接学习变量间的关系。这种范式切换类似从BERT到GPT,改变了模型学习目标和组织信息的方式,使模型能保留更多变量级细粒度信息,从而在分类、回归等任务上表现更优。

LimiX-2的三大技术支柱

LimiX-2通过CMNs、CCMM和Cell-Level表示构建了一套完整技术范式。CMNs将学习目标改为变量关系建模;CCMM通过上下文条件掩码建模,不断遮住-预测不同变量,迫使模型学习条件依赖和联合结构;Cell-Level以单元格为基础表示单元,保留列身份、具体取值和缺失状态,支持跨变量、跨样本交互。三者共同支撑了模型在多个基准上的领先表现。

从预测走向因果智能的路径

文章强调,LDM的长期能力路径是从Prediction走向Relationship、Causality、Intervention、Decision。LimiX-2已在Sachs、UF等公开数据集上领先多种传统因果发现方法,表明其不仅能预测,还能发现变量间的因果骨架。这指向通用因果智能,也是生产侧智能化下一阶段的关键方向,可能决定AGI下一阶段的能力上限。

Q&A

LimiX-2是什么?它由谁发布?

LimiX-2是稳准智能联合清华大学发布的一个400M参数的结构化数据基础模型,属于LDM(Large Data Model)路线。

LimiX-2在哪些国际基准测试中取得了第一?

LimiX-2在TabArena、TALENT、BCCO三个国际主流基准测试中,在二分类、多分类和回归任务上均排名第一。

LimiX-2的核心技术创新是什么?

LimiX-2的核心创新是上下文机制网络CMNs(Contextual Mechanism Networks),将建模目标从目标预测转向变量关系与因果机制学习,学习跨变量、跨样本的联合依赖结构。

LDM和LLM有什么区别?

LLM主要处理已经语义化的文本、代码等数据,学习人类已表达的知识;而LDM直接面向结构化数据,学习变量之间的关系、条件关系和生成机制,更接近真实世界的高维数据空间。

LimiX-2在因果发现方面有什么表现?

LimiX-2在Sachs、UF、Causal Chamber等公开数据集上,已经领先多种传统因果发现方法。

LDM赛道目前有哪些主要玩家?

LDM赛道的主要玩家包括Google(TabFM)、Amazon(Mitra)、SAP(收购TabPFN背后的Prior Labs)以及中国的稳准智能(LimiX系列)等。

🏷️

标签

➡️

继续阅读